Bonsai 1.7B : modèle ternaire atteint 442 T/s sur M4 Max avec des noyaux Metal réglés de manière autonome

✍️ OpenClawRadar📅 Publié: May 4, 2026🔗 Source
Bonsai 1.7B : modèle ternaire atteint 442 T/s sur M4 Max avec des noyaux Metal réglés de manière autonome
Ad

Bonsai 1.7B — un modèle ternaire de PrismML — a été optimisé pour Apple Silicon en utilisant des kernels Metal ajustés de manière autonome. Le travail a été réalisé par ata, un agent d'ingénierie autonome d'Agents2Agents, qui a effectué une recherche évolutive agentique pendant 6 heures pour produire des kernels GPU personnalisés.

Résultats des benchmarks

Mesurés par rapport à la version amont de llama.cpp au même commit Bonsai/Q2_0 sur un M4 Max (même fichier modèle, même configuration llama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99) :

  • Décodage (tg128) : 311,66 → 442,42 t/s (+42,0 %)
  • Préremplissage (pp512) : 4250,32 → 4622,63 t/s (+8,8 %)

Pour contexte, le livre blanc de Bonsai 8B rapporte un décodage MLX-amont Q2_0 à 235 t/s sur Apple Silicon. Cette version atteint 442 t/s sur la variante 1.7B via des kernels Metal personnalisés (framework différent, modèle plus petit — indication directionnelle de la marge dans la pile).

Ce qui est inclus

La version est un package d'inférence optimisé prêt à l'emploi pour les Mac de la série M (arm64 uniquement). Dans le tar.xz de 358 Mo :

  • chat.sh — REPL interactif
  • complete.sh — complétion non interactive
  • bench.sh — reproduire les benchmarks
  • server.sh — API HTTP compatible OpenAI sur :8080
  • Bonsai-1.7B-Q2_0.gguf — le fichier modèle (442 Mo)
Ad

Démarrage rapide

tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.sh

Détails techniques

Chaque kernel Metal a été créé et ajusté par ata sans intervention humaine. Le travail s'est concentré sur les kernels GPU personnalisés au niveau de la couche matvec / FFN / cache KV, spécialisés par forme pour le chemin de décodage Bonsai 1.7B Q2_0. La sortie numérique correspond à la version de référence (vérification de la correspondance du premier token). Testé sur M4 Max ; des gains proportionnels attendus sur M1+.

Mises en garde

  • Apple Silicon uniquement (arm64) — pas de version pour Intel Mac ou CPU uniquement.
  • Chiffres provenant du M4 Max ; M1/M2/M3 seront inférieurs en raison d'une bande passante mémoire moindre.
  • Le modèle est quantifié en Q2_0 — faible différence de précision par rapport au F16.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Opus 4.6 Moyen vs Faible : Différences de Performance et Tarification
News

Opus 4.6 Moyen vs Faible : Différences de Performance et Tarification

Opus 4.6 moyen coûte environ 50 % de plus que la version basse, mais résout d'importants problèmes de paresse observés dans le modèle peu puissant. La version moyenne se situe entre les versions basse et haute dans les benchmarks de performance.

OpenClawRadar
🦀
News

Filigrane de texte d'Anthropic dans Claude : explication de la stéganographie sémantique

Le nouveau filigrane texte d'Anthropic manipule les choix de tokens pour intégrer des empreintes, contredisant leur affirmation d'invisibilité. Gruber détaille la technique des listes verte/rouge.

OpenClawRadar
La mémoire des agents n'est pas un problème de stockage : c'est un problème d'autorité
News

La mémoire des agents n'est pas un problème de stockage : c'est un problème d'autorité

Un développeur affirme que la mémoire des agents échoue non pas à cause de la récupération, mais parce que toutes les notes reviennent avec la même autorité. La solution : un graphe avec des rôles, des dates d'expiration et des champs d'activation.

OpenClawRadar
Contributeur d'OpenClaw critique l'accent mis sur une parfaite fidélité visuelle au détriment de fonctionnalités modernes
News

Contributeur d'OpenClaw critique l'accent mis sur une parfaite fidélité visuelle au détriment de fonctionnalités modernes

Un post Reddit sur r/openclaw détaille comment une PR d'un contributeur visant à résoudre les problèmes de mise à l'échelle de la résolution et à ajouter la prise en charge des taux de rafraîchissement élevés a été rejetée car elle s'écartait des contraintes visuelles du moteur d'origine, déclenchant un débat sur l'orientation du projet.

OpenClawRadar