Bonsai 27B : Premier modèle de classe 27B fonctionnant sur un téléphone — Scores de référence et spécifications

✍️ OpenClawRadar📅 Publié: July 15, 2026🔗 Source
Bonsai 27B : Premier modèle de classe 27B fonctionnant sur un téléphone — Scores de référence et spécifications
Ad

PrismML a publié Bonsai 27B, le premier modèle de classe 27 milliards de paramètres qui tient et fonctionne sur un téléphone. Basé sur Qwen 3.6 27B, il utilise une quantification extrême en bits faibles — poids ternaires ou binaires — pour réduire le modèle à 3,9 Go (variante 1 bit) ou 5,9 Go (variante ternaire), contre 54 Go en précision 16 bits.

Deux variantes : Ternaire vs 1 bit

  • Bonsai 27B Ternaire : poids dans {−1, 0, +1} avec mise à l'échelle par groupe en FP16, 1,71 bits effectifs par poids. Taille : 5,9 Go. Destiné aux ordinateurs portables avec raisonnement complet, appel d'outils et capacité agentique.
  • Bonsai 27B 1 bit : poids binaires {−1, +1}, 1,125 bit effectif par poids. Taille : 3,9 Go. Tient dans la mémoire de l'iPhone 17 Pro.

Les deux variantes font fonctionner l'intégralité du réseau (embeddings, attention, MLPs, tête LM) en faible précision — sans échappatoire en haute précision. Ils prennent en charge un contexte de 262K tokens, la vision multimodale (tour de vision 4 bits) et le décodage spéculatif.

Ad

Scores de référence (mode réflexion)

Sur une suite de 15 benchmarks :

  • Mathématiques (GSM8K, MATH-500, AIME25, AIME26) : Qwen 3.6 27B 95,3, Ternaire 93,4, 1 bit 91,7
  • Code (HumanEval+, MBPP+, LiveCodeBench) : 88,7 → 86,0 → 81,9
  • Agentique/Appel d'outils (BFCL v3, TauBench) : 80,0 → 74,0 → 66,0
  • Suivi d'instructions (IFEval, IFBench) : 78,4 → 71,8 → 65,8
  • Connaissances/STEM (MMLU-Redux, MuSR) : 83,1 → 77,0 → 73,4
  • Vision (MMMU Pro, OCRBench) : 72,6 → 65,2 → 59,6
  • Global : 85,0 → 80,5 (95 % de rétention) → 76,1 (90 % de rétention)

Les mathématiques et le code sont les moins touchés — essentiel pour les charges de travail agentiques. La variante 1 bit à 3,9 Go est plus petite qu'un modèle 2B en pleine précision, tout en offrant une intelligence de classe 27B.

Pourquoi l'exécution locale est importante pour les agents

Les charges de travail agentiques nécessitent de nombreux appels séquentiels au modèle — chacun transportant un contexte et produisant une sortie structurée. Une exécution exclusivement dans le cloud implique une latence par étape, des coûts de tokens cumulés et l'envoi de données privées (captures d'écran, fichiers) sur le réseau. L'exécution locale élimine ces contraintes. Bonsai 27B permet des boucles agentiques de raisonnement multi-étapes, appels d'outils et utilisation de l'ordinateur sur l'appareil.

Licence et disponibilité

Les deux variantes sont disponibles dès aujourd'hui sous Licence Apache 2.0.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also