PrismMLs Bonsai 1-bit Qwen-Modelle getestet: 107 t/s Generierung auf 8 GB VRAM

✍️ OpenClawRadar📅 Veröffentlicht: 5. April 2026🔗 Source
PrismMLs Bonsai 1-bit Qwen-Modelle getestet: 107 t/s Generierung auf 8 GB VRAM
Ad

Bonsai-Modelle: 1-Bit-Qwen-Quantisierung von PrismML

PrismML hat Bonsai veröffentlicht, eine Reihe von 1-Bit-quantisierten Versionen der Qwen3-Modelle (8B, 4B und 1.7B Parameter). Diese Modelle nutzen extreme Quantisierung, um den Speicherbedarf drastisch zu reduzieren, während sie für bestimmte Aufgaben eine brauchbare Leistung beibehalten.

Leistungsbenchmarks aus Tests

Tests auf einer RTX 4060 mit 8GB VRAM zeigten:

  • Generierungsgeschwindigkeit von 107 Token/Sekunde
  • >1114 Token/Sekunde Prompt-Verarbeitung
  • Deutlich geringerer RAM-Verbrauch im Vergleich zu Q4-quantisierten Modellen

Zum Vergleich: Qwen 3.5 4B Q4 erreichte 56 t/s mit denselben Prompts auf derselben Hardware.

Praktische Auswirkungen

Der reduzierte Speicherbedarf ermöglicht das Ausführen von 8B-Parameter-Modellen auf Systemen mit 8GB VRAM. Kleinere Modelle können aufgrund der Speichereinsparungen mit längeren Kontextfenstern verwendet werden.

Qualitätsbewertung

Erste Tests konzentrierten sich auf Textzusammenfassung, wo das Modell gut abschnitt. Der Tester merkte an, dass er Programmier- oder Tool-Nutzungsfähigkeiten nicht bewertet habe.

Ad

Technische Einschränkungen

Die aktuelle Implementierung hat Probleme mit der CPU-Inferenz. Bei Tests auf einem Mini-PC ohne GPU:

  • Der llama.cpp-Fork kompiliert erfolgreich
  • Das Modell lädt, hängt aber während der Prompt-Verarbeitung
  • Analysen deuten darauf hin, dass keine CPU-Implementierung existiert – es dequantisiert wahrscheinlich zu FP32 und versucht reguläre Inferenz, was auf der CPU extrem langsam wäre

Technisches Potenzial

1-Bit-Modelle könnten nicht nur Bandbreiten- und Speicheranforderungen reduzieren, sondern auch Rechenanforderungen. Matrixmultiplikation auf 1-Bit-Matrizen könnte XOR-Operationen nutzen, die viel schneller sind als Gleitkommaoperationen. Selbst mit Skalierung auf FP16 nach XOR-Operationen sollten erhebliche Recheneinsparungen möglich sein, was potenziell CPU-only-Inferenz und Edge-Computing-Szenarien zugutekommen könnte.

Einzelheiten zum Setup

Der Tester lud herunter:

  • Das 8B-Bonsai-Modell
  • PrismMLs llama.cpp-Fork
  • Getestet unter Windows mit CUDA

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude-App-Store-Rankings in 7 Ländern
Nachrichten

Claude-App-Store-Rankings in 7 Ländern

Claude belegte Platz 1 in den USA und Kanada, Platz 3 in Frankreich und Deutschland, Platz 4 im Vereinigten Königreich, Platz 8 in Italien und Platz 22 in Japan in den Free-App-Rankings des App Stores, die gleichzeitig am 1. März 2026 um 09:00 UTC erfasst wurden.

OpenClawRadar
Die Analyse der Inferenzpreise zeigt eine 4,4-fache Preisspanne für dasselbe Modell bei verschiedenen Anbietern.
Nachrichten

Die Analyse der Inferenzpreise zeigt eine 4,4-fache Preisspanne für dasselbe Modell bei verschiedenen Anbietern.

Die Analyse der Inferenzpreise für Llama 3.1 70B Instruct zeigt eine 4,4-fache Kostenunterschied zwischen Anbietern, mit DeepInfra bei 0,20 $/0,27 $ pro Million Tokens und Together bei 0,88 $/0,88 $. Bei Reasoning-Modellen erreicht die Spanne etwa das 30-fache zwischen DeepSeek R1 und OpenAI o1.

OpenClawRadar
Claude-Code v2.1.72: SSH-Verbesserungen, reduzierte Berechtigungsabfragen und Fehlerbehebungen
Nachrichten

Claude-Code v2.1.72: SSH-Verbesserungen, reduzierte Berechtigungsabfragen und Fehlerbehebungen

Claude-Code v2.1.72 fügt SSH-freundliches Dateischreiben mit /copy w-Taste hinzu, reduziert Bash-Berechtigungsaufforderungen durch Hinzufügen gängiger Tools zur Auto-Genehmigungs-Whitelist und behebt über 20 Fehler, darunter Probleme mit dem Sprachmodus und Plugin-Installationsprobleme.

OpenClawRadar
OpenClaw Frühe Nutzerberichte über Probleme mit Telegram, Agentenprofil-Hardcoding und Sitzungsrücksetzungen
Nachrichten

OpenClaw Frühe Nutzerberichte über Probleme mit Telegram, Agentenprofil-Hardcoding und Sitzungsrücksetzungen

Die ersten drei Tage eines Nutzers mit OpenClaw offenbarten mehrere praktische Herausforderungen: Telegram-Antworten verschwinden, Agentenprofile im Quellcode auf 'Messaging' festgelegt und Wacli wird nach Sitzungszurücksetzungen nicht verfügbar. Der Nutzer führte Mikrotests auf Docker durch, verband Telegram und Wacli und richtete einen Heartbeat ein.

OpenClawRadar