PrismMLs Bonsai 1-bit Qwen-Modelle getestet: 107 t/s Generierung auf 8 GB VRAM

✍️ OpenClawRadar📅 Veröffentlicht: 5. April 2026🔗 Source
PrismMLs Bonsai 1-bit Qwen-Modelle getestet: 107 t/s Generierung auf 8 GB VRAM
Ad

Bonsai-Modelle: 1-Bit-Qwen-Quantisierung von PrismML

PrismML hat Bonsai veröffentlicht, eine Reihe von 1-Bit-quantisierten Versionen der Qwen3-Modelle (8B, 4B und 1.7B Parameter). Diese Modelle nutzen extreme Quantisierung, um den Speicherbedarf drastisch zu reduzieren, während sie für bestimmte Aufgaben eine brauchbare Leistung beibehalten.

Leistungsbenchmarks aus Tests

Tests auf einer RTX 4060 mit 8GB VRAM zeigten:

  • Generierungsgeschwindigkeit von 107 Token/Sekunde
  • >1114 Token/Sekunde Prompt-Verarbeitung
  • Deutlich geringerer RAM-Verbrauch im Vergleich zu Q4-quantisierten Modellen

Zum Vergleich: Qwen 3.5 4B Q4 erreichte 56 t/s mit denselben Prompts auf derselben Hardware.

Praktische Auswirkungen

Der reduzierte Speicherbedarf ermöglicht das Ausführen von 8B-Parameter-Modellen auf Systemen mit 8GB VRAM. Kleinere Modelle können aufgrund der Speichereinsparungen mit längeren Kontextfenstern verwendet werden.

Qualitätsbewertung

Erste Tests konzentrierten sich auf Textzusammenfassung, wo das Modell gut abschnitt. Der Tester merkte an, dass er Programmier- oder Tool-Nutzungsfähigkeiten nicht bewertet habe.

Ad

Technische Einschränkungen

Die aktuelle Implementierung hat Probleme mit der CPU-Inferenz. Bei Tests auf einem Mini-PC ohne GPU:

  • Der llama.cpp-Fork kompiliert erfolgreich
  • Das Modell lädt, hängt aber während der Prompt-Verarbeitung
  • Analysen deuten darauf hin, dass keine CPU-Implementierung existiert – es dequantisiert wahrscheinlich zu FP32 und versucht reguläre Inferenz, was auf der CPU extrem langsam wäre

Technisches Potenzial

1-Bit-Modelle könnten nicht nur Bandbreiten- und Speicheranforderungen reduzieren, sondern auch Rechenanforderungen. Matrixmultiplikation auf 1-Bit-Matrizen könnte XOR-Operationen nutzen, die viel schneller sind als Gleitkommaoperationen. Selbst mit Skalierung auf FP16 nach XOR-Operationen sollten erhebliche Recheneinsparungen möglich sein, was potenziell CPU-only-Inferenz und Edge-Computing-Szenarien zugutekommen könnte.

Einzelheiten zum Setup

Der Tester lud herunter:

  • Das 8B-Bonsai-Modell
  • PrismMLs llama.cpp-Fork
  • Getestet unter Windows mit CUDA

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Pentagon übermittelt Anthropic letztes Angebot für militärische KI-Nutzung im Streit
Nachrichten

Pentagon übermittelt Anthropic letztes Angebot für militärische KI-Nutzung im Streit

Das Pentagon hat Anthropic ein endgültiges und bestes Angebot für die uneingeschränkte militärische Nutzung seines Claude-KI-Modells übermittelt, mit einer Frist bis Freitag, um vollen Zugriff zu gewähren, andernfalls droht der Verlust von Militärgeschäften und die Einstufung als Lieferkettenrisiko.

OpenClawRadar
Alibaba startet Wukong AI-Plattform für Unternehmensautomatisierung
Nachrichten

Alibaba startet Wukong AI-Plattform für Unternehmensautomatisierung

Alibaba hat Wukong gestartet, eine KI-Plattform, die mehrere Agenten koordiniert, um komplexe Geschäftsaufgaben wie Dokumentenbearbeitung, Tabellenkalkulationsaktualisierungen, Meeting-Transkription und Recherche zu bewältigen. Sie befindet sich derzeit in einer Einladungs-Betatestphase.

OpenClawRadar
Die 100.000 Warums der KI: Wie quasi-deterministische LLM-Ausgaben typischen Schrott erzeugen
Nachrichten

Die 100.000 Warums der KI: Wie quasi-deterministische LLM-Ausgaben typischen Schrott erzeugen

Lcamtuf argumentiert, dass sich LLM-Ausgaben von menschengeschriebenen Texten nicht durch individuelle Eigenheiten, sondern durch quasi-deterministische Wiederholung derselben komplexen Muster über viele Prompts hinweg unterscheiden. Die Amazon-Buchcover zu '100000 Whys' verdeutlichen dies.

OpenClawRadar
KI's Erschwinglichkeitskrise: OpenAI und Anthropic verbrennen 8–14 Dollar, um 1 Dollar zu verdienen
Nachrichten

KI's Erschwinglichkeitskrise: OpenAI und Anthropic verbrennen 8–14 Dollar, um 1 Dollar zu verdienen

Die Analyse von DSHR zeigt, dass KI-Plattformen Token um das 40- bis 70-fache subventionieren; OpenAI verlor 2025 bei 13 Mrd. US-Dollar Umsatz 38,5 Mrd. US-Dollar und gab 44 % für Vertrieb und Marketing aus.

OpenClawRadar