Bonsai 2 (Qwen 3.8 27B) comme solution de repli pour OpenClaw : 8 Go, 85 tok/s sur une 5070
Ternary-Bonsai-2-27B de PrismML est une version quantifiée de Qwen3 3.8 27B qu'un utilisateur de r/openclaw fait tourner en local comme modèle de secours pour OpenClaw lorsque ses quotas ChatGPT et Grok sont épuisés. Ses affirmations : environ 8 Go d'empreinte, 98 % de la qualité du Qwen3 27B de base conservée, et prise en charge du texte et de la vision.
Les chiffres de la configuration
- Vitesse de sortie : 85 tok/s
- Matériel : RTX 5070 avec 16 Go de VRAM, 64 Go de mémoire système
- Empreinte disque : ~8 Go
- Conservation de la qualité : 98 % de Qwen3 3.8 27B rapportés
Les deux GGUF nécessaires
Les fichiers proviennent du dépôt prism-ml/Ternary-Bonsai-2-27B-gguf sur Hugging Face :
Ternary-Bonsai-2-27B-PQ2_0.gguf (texte) Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf (vision)
Les deux sont requis si vous voulez la voie multimodale — le fichier mmproj est le projecteur de vision, le fichier PQ2_0 contient les poids texte ternarisés.
Notes d'installation
Bonsai 2 exige le fork de llama.cpp propre à PrismML — il ne se chargera pas dans llama.cpp standard. L'auteur a fait configurer le fork par GPT sur une machine IA distincte de l'hôte OpenClaw, avec le modèle configuré pour :
- Se charger dynamiquement quand OpenClaw l'appelle
- Se décharger après 10 minutes d'inactivité
- Servir de secours quand GPT 5.6 et Grok atteignent leurs limites d'usage
Ce qu'il a réellement fait
Le plus intéressant n'est pas le tok/s — c'est le comportement agentique. D'après le post, il a géré la recherche web via un navigateur, le contrôle de VM, l'installation et l'utilisation de nouveaux logiciels, et l'exécution de workflows existants, au point que l'auteur dit ne « pas pouvoir dire que ce n'est pas un modèle de pointe ».
Il s'agit du témoignage d'un seul utilisateur, pas d'un benchmark, donc considérez les affirmations sur la qualité comme anecdotiques. Le motif chargement/déchargement sur inactivité est le point pratique à retenir : il garde un 27B local résident uniquement quand votre fournisseur payant est limité en débit, ce qui est une façon sensée d'éviter de brûler en permanence de la VRAM sur une machine qui fait aussi d'autres tâches.
Si vous avez un GPU avec 16 Go+ de VRAM, la paire PQ2_0 + mmproj est suffisamment petite pour valoir le test face à vos propres tâches agentiques avant de décider si elle tient la route pour vous.
📖 Lire la source complète : r/openclaw
👀 See Also

Vibeyard : Tableau de bord open source qui lance des sessions Claude depuis les PR, les issues et les cartes Kanban
Vibeyard est un écran d'accueil open-source (MIT) avec des widgets déplaçables pour les PRs, les tickets, les kanbans et les sessions Claude. Cliquez sur n'importe quelle carte pour lancer une session Claude Code pré-ciblée pour une révision, une planification de correctif ou une reprise.

Six dépôts GitHub pour le développement de code avec Claude
Un utilisateur de Reddit a testé et partagé six dépôts GitHub conçus pour améliorer les projets Claude Code, incluant des outils pour le développement structuré, la génération d'interface utilisateur, la gestion des tâches, la mémoire, l'exploration de l'écosystème et l'automatisation des flux de travail.

Un développeur indie déploie un site complet de studio de jeu via Claude Code, incluant une couche de données API Steam
Un développeur de jeux indépendant a utilisé Claude Code pour construire et déployer un site web de studio de jeux sans toucher à un terminal, y compris une couche de données qui récupère des informations en direct depuis l'API Steam.

FR : CC-Wiki : Transformez les sessions Claude Code en une base de connaissances Quartz partageable
CC-Wiki convertit votre historique de sessions ~/.claude en une base de connaissances basée sur Quartz. Une seule commande l'installe ; lancer /cc-wiki dans une session Claude Code empaquette la conversation.