Image Bonsaï 1-Bit 4B : Génération d’Images sur Appareil via FLUX.2 Binaire/Ternaire

PrismML a publié Bonsai Image 4B, une famille de modèles compacts de génération d'images dérivés de FLUX.2 Klein 4B utilisant une quantification binaire et ternaire. Les poids du transformateur de diffusion sont représentés sous forme {−1, +1} (1 bit) ou {−1, 0, +1} (ternaire) avec des facteurs d'échelle par groupe FP16, donnant respectivement 1,125 et 1,71 bits effectifs par poids.
Spécifications clés
- Bonsai Image 4B 1 bit : empreinte du transformateur 0,93 Go (réduction de 8,3× par rapport aux 7,75 Go FP16 de FLUX.2 Klein 4B). La charge Apple Silicon (incluant l'encodeur de texte compressé + VAE FP16) est de 3,42 Go.
- Bonsai Image 4B ternaire : empreinte du transformateur 1,21 Go (réduction de 6,4×). Charge Apple Silicon 3,88 Go.
- Mémoire active moyenne pour une génération 512×512 : 1,5 Go (1 bit) / 1,96 Go (ternaire) contre 11,74 Go pour le FLUX.2 Klein 4B original.
- Pour 1024×1024 : 1,95 Go / 2,38 Go contre 14,39 Go.
Références de performance
Le modèle fonctionne sur Apple Silicon (iPhones, iPads, Macs) via les chemins basse latence MLX, et sur GPU CUDA via les noyaux GEMM basse latence Gemlite. Temps de génération :
- iPhone 17 Pro Max : 9,4 secondes pour une image 512×512
- Mac M4 Pro : ~6 secondes pour une image 512×512 (jusqu'à 5,6× plus rapide que le pipeline MFLUX standard en précision complète)
La réduction du transformateur est obtenue via des couches binaires/ternaires (~14× / ~10× de compression par rapport au FP16), tandis qu'un petit ensemble de couches de projection sensibles à la précision (~5%) reste en FP16. Le modèle est évalué sur GenEval, HPSv3 et DPG-Bench pour la qualité et la fidélité aux prompts.
À qui s'adresse-t-il ?
Développeurs déployant la génération d'images sur l'appareil (ordinateurs portables, téléphones, périphériques) ayant besoin de poids ouverts et d'inférence locale pratique sans dépendance au cloud.
📖 Lire la source complète : HN LLM Tools
👀 See Also
Claude Code v2.1.236 : Nouvelle variable d'environnement de modèle par défaut, correctifs de bac à sable, et plus encore
Claude Code v2.1.236 ajoute ANTHROPIC_DEFAULT_MODEL pour définir le modèle pour les nouvelles sessions, introduit notify_when_idle pour les notifications inter-sessions, et renforce les règles de refus de lecture du sandbox macOS.

OpenAI et ses rivaux publient des plugins d'agents : un format de package unique pour les agents IA
OpenAI, Amazon, Microsoft, Cursor et Vercel ont publié Agent Plugins 1.0, un standard ouvert pour empaqueter les extensions d'agents IA. Créez une fois, exécutez sur ChatGPT, Codex, Copilot, Cursor, et plus.

Choisir le Meilleur Fournisseur de Jetons pour Vos Besoins d'API
Découvrez les facteurs clés à prendre en compte lors du choix d'un fournisseur de jetons et d'API pour le codage et l'automatisation de l'IA, basé sur les insights de la communauté OpenClaw.
Claude Code v2.1.243 : panne des boucles, sélecteur de modèle, TTL de cache et correctifs de stabilité
Claude Code v2.1.243 ajoute une ventilation des boucles /usage, un sélecteur de modèle configurable, des paramètres de TTL de cache d'invite, et des correctifs pour la reconnexion MCP, le mode auto, et plus.