Cerebras lance les modèles Step-3.5-Flash-REAP avec une réduction de 40 % de la mémoire.

✍️ OpenClawRadar📅 Publié: February 25, 2026🔗 Source
Cerebras lance les modèles Step-3.5-Flash-REAP avec une réduction de 40 % de la mémoire.
Ad

Ce que c'est

Cerebras a publié les modèles Step-3.5-Flash-REAP, des variantes compressées et économes en mémoire de leurs modèles plus grands. Ce sont des versions réduites conçues pour ce que la source appelle des "configurations basiques", bien que le modèle de 121B paramètres nécessite toujours des ressources significatives.

Détails clés de la source

Les modèles sont disponibles sur Hugging Face :

Le modèle Step-3.5-Flash-REAP-121B-A11B est compressé de 196B à 121B paramètres, représentant une réduction de mémoire de 40% tout en maintenant des performances quasi identiques au modèle complet.

La compression utilise REAP (Router-weighted Expert Activation Pruning), décrit comme "une nouvelle méthode d'élagage d'experts qui supprime sélectivement les experts redondants tout en préservant le contrôle indépendant du routeur sur les experts restants".

Ad

Fonctionnalités et capacités

  • Performances quasi sans perte : Maintient une précision presque identique pour la génération de code, le codage agentique et les tâches d'appel de fonction par rapport au modèle complet de 196B
  • Réduction de mémoire de 40% : Compressé de 196B à 121B paramètres, réduisant les coûts de déploiement et les besoins en mémoire
  • Capacités préservées : Conserve toutes les fonctionnalités principales, y compris la génération de code, les mathématiques et le raisonnement, et l'appel d'outils
  • Compatibilité immédiate : Fonctionne avec vLLM standard - aucune modification de la source ou correctif personnalisé requis
  • Optimisé pour un usage réel : Particulièrement efficace pour les environnements aux ressources limitées, les déploiements locaux et la recherche académique

La source note que bien que ce soient des "versions réduites", le modèle de 121B nécessite toujours une configuration assez puissante malgré la compression.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

La Chine interdit aux cofondateurs de Manus de quitter le pays pendant l'examen de l'accord avec Meta
News

La Chine interdit aux cofondateurs de Manus de quitter le pays pendant l'examen de l'accord avec Meta

La Chine a interdit à deux cofondateurs de la startup d'IA Manus de quitter le pays alors que les régulateurs examinent si l'acquisition de 2 milliards de dollars par Meta a enfreint les règles d'investissement. Les dirigeants ont été convoqués à Pékin pour une réunion avec la Commission nationale du développement et de la réforme ce mois-ci.

OpenClawRadar
Oracle interdit le code généré par IA dans OpenJDK malgré l'utilisation interne de LLM
News

Oracle interdit le code généré par IA dans OpenJDK malgré l'utilisation interne de LLM

Oracle interdit le code généré par IA dans les contributions OpenJDK, citant des risques de sécurité et de propriété intellectuelle. Cela contredit la déclaration du PDG Larry Ellison selon laquelle l'IA écrit le code d'Oracle.

OpenClawRadar
Bench du cache KV Qwen 3.6-35B-A3B : f16 vs q8_0 vs Turbo3 vs Turbo4 sur M5 Max jusqu'à 1M de contexte
News

Bench du cache KV Qwen 3.6-35B-A3B : f16 vs q8_0 vs Turbo3 vs Turbo4 sur M5 Max jusqu'à 1M de contexte

Les benchmarks du fork TurboQuant Metal de TheTom sur M5 Max montrent que f16 et q8_0 manquent de mémoire au-delà de 256K, tandis que turbo3 atteint 1M à 6,5 tok/s en décodage. La séparation préremplissage/décodage favorise turbo3 pour le préremplissage et turbo4 pour le décodage sur les longs contextes.

OpenClawRadar
L'UE oblige Google à ouvrir Android AI à des tiers en vertu du DMA
News

L'UE oblige Google à ouvrir Android AI à des tiers en vertu du DMA

La Commission européenne propose des mesures pour permettre aux assistants IA tiers d'accéder au niveau système sur Android, y compris l'invocation par mot-clé, le contexte d'écran et l'accès au matériel pour les modèles locaux. Google qualifie cela d'« intervention injustifiée ».

OpenClawRadar