Les modèles Bonsai 1-bit Qwen de PrismML testés : génération à 107 t/s sur 8 Go de VRAM

✍️ OpenClawRadar📅 Publié: April 5, 2026🔗 Source
Les modèles Bonsai 1-bit Qwen de PrismML testés : génération à 107 t/s sur 8 Go de VRAM
Ad

Modèles Bonsai : quantification sur 1 bit de Qwen par PrismML

PrismML a publié Bonsai, un ensemble de versions quantifiées sur 1 bit des modèles Qwen3 (8B, 4B et 1,7B paramètres). Ces modèles utilisent une quantification extrême pour réduire considérablement les besoins en mémoire tout en conservant des performances utilisables pour certaines tâches.

Benchmarks de performance issus des tests

Les tests sur une RTX 4060 avec 8 Go de VRAM ont montré :

  • Une vitesse de génération de 107 tokens/seconde
  • Un traitement de prompt >1114 tokens/seconde
  • Une utilisation de la RAM nettement inférieure par rapport aux modèles quantifiés en Q4

À titre de comparaison, Qwen 3.5 4B Q4 a atteint 56 t/s avec les mêmes prompts sur le même matériel.

Implications pratiques

L'empreinte mémoire réduite permet d'exécuter des modèles de 8B paramètres sur des systèmes avec 8 Go de VRAM. Les modèles plus petits peuvent être utilisés avec des fenêtres de contexte plus longues grâce aux économies de mémoire.

Évaluation de la qualité

Les premiers tests se sont concentrés sur la synthèse de texte, où le modèle a bien performé. Le testeur a noté qu'il n'avait pas évalué les capacités de codage ou d'utilisation d'outils.

Ad

Limitations techniques

L'implémentation actuelle présente des problèmes d'inférence sur CPU. Lors des tests sur un mini PC sans GPU :

  • Le fork llama.cpp compile avec succès
  • Le modèle se charge mais se bloque pendant le traitement du prompt
  • L'analyse suggère qu'aucune implémentation CPU n'existe - il déquantise probablement en FP32 et tente une inférence normale, ce qui serait extrêmement lent sur CPU

Potentiel technique

Les modèles sur 1 bit pourraient réduire non seulement les besoins en bande passante et en mémoire, mais aussi en calcul. La multiplication matricielle sur des matrices 1 bit pourrait utiliser des opérations XOR, qui sont beaucoup plus rapides que les opérations en virgule flottante. Même avec une mise à l'échelle en FP16 après les opérations XOR, des économies de calcul significatives devraient être possibles, bénéficiant potentiellement aux scénarios d'inférence uniquement sur CPU et de calcul en périphérie.

Détails de configuration

Le testeur a téléchargé :

  • Le modèle Bonsai 8B
  • Le fork llama.cpp de PrismML
  • Testé sur Windows avec CUDA

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

La Plateforme Polsia Montre des Modèles SaaS Répétitifs dans les Lancements en Direct des Fondateurs
News

La Plateforme Polsia Montre des Modèles SaaS Répétitifs dans les Lancements en Direct des Fondateurs

Polsia est une plateforme commerciale autonome où les utilisateurs décrivent leur entreprise, paient de l'argent, et celle-ci s'exécute de manière autonome. Un scientifique comportemental a observé 72 heures de lancements en direct de fondateurs, identifiant des schémas répétitifs comme les solutions d'automatisation SDR par IA et les marchés internationaux sous-desservis.

OpenClawRadar
Qwen3.6 Plus Preview Disponible Gratuitement via OpenRouter pour OpenClaw
News

Qwen3.6 Plus Preview Disponible Gratuitement via OpenRouter pour OpenClaw

Le modèle Qwen3.6 Plus Preview est désormais accessible gratuitement via OpenRouter pour les utilisateurs d'OpenClaw. La configuration nécessite d'obtenir des clés API auprès d'OpenRouter et de les configurer dans OpenClaw, avec une invite pour définir le niveau de réflexion lors de la première utilisation.

OpenClawRadar
Titre de l'article traduit : Mises à jour des invites système de Claude Code : Nouveau rappel de modification de fichier et clarifications REPL, rappel d'analyse de malware supprimé
News

Titre de l'article traduit : Mises à jour des invites système de Claude Code : Nouveau rappel de modification de fichier et clarifications REPL, rappel d'analyse de malware supprimé

Les versions 2.1.124 (+166 tokens) et 2.1.126 (-87 tokens) de Claude Code (CC) mettent à jour le prompt système : ajout d'une détection de modification de fichier avec avertissement de dépassement de budget, remplacement de la fonction core-identity par des instructions explicites du harness, clarification du comportement d'auto-attente des thenables dans le REPL, et suppression du rappel d'analyse de malware.

OpenClawRadar
OpenClaw : une utilisation concrète dans les PME — article offert partagé depuis Reddit
News

OpenClaw : une utilisation concrète dans les PME — article offert partagé depuis Reddit

Un article du New York Times Magazine présente des utilisateurs d'OpenClaw interrogés sur leurs cas d'usage professionnels, initialement publié sur r/openclaw. Lien cadeau inclus.

OpenClawRadar