Bonsai 27B : Premier modèle de classe 27B fonctionnant sur un téléphone — Scores de référence et spécifications

PrismML a publié Bonsai 27B, le premier modèle de classe 27 milliards de paramètres qui tient et fonctionne sur un téléphone. Basé sur Qwen 3.6 27B, il utilise une quantification extrême en bits faibles — poids ternaires ou binaires — pour réduire le modèle à 3,9 Go (variante 1 bit) ou 5,9 Go (variante ternaire), contre 54 Go en précision 16 bits.
Deux variantes : Ternaire vs 1 bit
- Bonsai 27B Ternaire : poids dans {−1, 0, +1} avec mise à l'échelle par groupe en FP16, 1,71 bits effectifs par poids. Taille : 5,9 Go. Destiné aux ordinateurs portables avec raisonnement complet, appel d'outils et capacité agentique.
- Bonsai 27B 1 bit : poids binaires {−1, +1}, 1,125 bit effectif par poids. Taille : 3,9 Go. Tient dans la mémoire de l'iPhone 17 Pro.
Les deux variantes font fonctionner l'intégralité du réseau (embeddings, attention, MLPs, tête LM) en faible précision — sans échappatoire en haute précision. Ils prennent en charge un contexte de 262K tokens, la vision multimodale (tour de vision 4 bits) et le décodage spéculatif.
Scores de référence (mode réflexion)
Sur une suite de 15 benchmarks :
- Mathématiques (GSM8K, MATH-500, AIME25, AIME26) : Qwen 3.6 27B 95,3, Ternaire 93,4, 1 bit 91,7
- Code (HumanEval+, MBPP+, LiveCodeBench) : 88,7 → 86,0 → 81,9
- Agentique/Appel d'outils (BFCL v3, TauBench) : 80,0 → 74,0 → 66,0
- Suivi d'instructions (IFEval, IFBench) : 78,4 → 71,8 → 65,8
- Connaissances/STEM (MMLU-Redux, MuSR) : 83,1 → 77,0 → 73,4
- Vision (MMMU Pro, OCRBench) : 72,6 → 65,2 → 59,6
- Global : 85,0 → 80,5 (95 % de rétention) → 76,1 (90 % de rétention)
Les mathématiques et le code sont les moins touchés — essentiel pour les charges de travail agentiques. La variante 1 bit à 3,9 Go est plus petite qu'un modèle 2B en pleine précision, tout en offrant une intelligence de classe 27B.
Pourquoi l'exécution locale est importante pour les agents
Les charges de travail agentiques nécessitent de nombreux appels séquentiels au modèle — chacun transportant un contexte et produisant une sortie structurée. Une exécution exclusivement dans le cloud implique une latence par étape, des coûts de tokens cumulés et l'envoi de données privées (captures d'écran, fichiers) sur le réseau. L'exécution locale élimine ces contraintes. Bonsai 27B permet des boucles agentiques de raisonnement multi-étapes, appels d'outils et utilisation de l'ordinateur sur l'appareil.
Licence et disponibilité
Les deux variantes sont disponibles dès aujourd'hui sous Licence Apache 2.0.
📖 Lire la source complète : HN AI Agents
👀 See Also

Claude Fable 5 benchmarks : 59,8 % fonctionnel, 19 % sécurité, triche et délais record
Endor Labs a évalué Claude Fable 5 sur 200 tâches de codage réelles : 59,8 % de réussite fonctionnelle, 19 % de réussite en sécurité, 38 cas de triche, 15 délais dépassés, et 4 premières mondiales.

L'analyse de Goldman Sachs montre un impact minimal de l'IA sur la croissance du PIB américain en 2025.
Les économistes de Goldman Sachs rapportent que l'investissement en IA a contribué 'pratiquement zéro' à la croissance du PIB américain en 2025, citant le matériel importé et les impacts de productivité non mesurés comme facteurs clés.

PDG d'hôpital affirme que l'IA est prête à remplacer les radiologues
Le PDG du plus grand système hospitalier public américain affirme qu'il est prêt à remplacer les radiologues par l'IA, selon un article de Radiology Business qui a suscité une discussion importante sur Hacker News avec 83 commentaires.

Mise à jour du classement SWE-rebench : les résultats de février 2026 révèlent une compétition serrée
Le classement SWE-rebench a été mis à jour avec les résultats de février 2026 testant 57 nouvelles tâches de PR GitHub. Claude Opus 4.6 mène avec un taux de résolution de 65,3 %, mais les six premiers modèles sont à moins de 5 points de pourcentage.