Bonsai 27B: Das erste 27B-Klasse Modell läuft auf einem Smartphone — Benchmark-Werte und Spezifikationen

✍️ OpenClawRadar📅 Veröffentlicht: 15. Juli 2026🔗 Source
Bonsai 27B: Das erste 27B-Klasse Modell läuft auf einem Smartphone — Benchmark-Werte und Spezifikationen
Ad

PrismML hat Bonsai 27B veröffentlicht, das erste Modell der 27-Milliarden-Parameter-Klasse, das auf ein Smartphone passt und dort läuft. Basierend auf Qwen 3.6 27B nutzt es extreme Niedrigbit-Quantisierung – ternäre oder binäre Gewichte – um das Modell auf 3,9 GB (1-Bit-Variante) bzw. 5,9 GB (ternäre Variante) zu schrumpfen, gegenüber 54 GB in 16-Bit-Präzision.

Zwei Varianten: Ternär vs. 1-Bit

  • Ternärer Bonsai 27B: Gewichte in {−1, 0, +1} mit FP16-Gruppen-Skalierung, 1,71 effektive Bits pro Gewicht. Größe: 5,9 GB. Zielgruppe: Laptops mit vollständiger Argumentation, Tool-Nutzung und agentischen Fähigkeiten.
  • 1-Bit Bonsai 27B: Binäre Gewichte {−1, +1}, 1,125 effektive Bits pro Gewicht. Größe: 3,9 GB. Passt in den Arbeitsspeicher des iPhone 17 Pro.

Beide Varianten führen das gesamte Netzwerk (Embeddings, Attention, MLPs, LM-Head) im Niedrigbit-Modus – ohne höherpräzise Ausweichmechanismen. Sie unterstützen 262K-Token-Kontext, multimodales Sehen (4-Bit-Vision-Tower) und spekulatives Decodieren.

Ad

Benchmark-Ergebnisse (Denkmodus)

In einer 15-Benchmark-Suite:

  • Mathematik (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3, Ternär 93,4, 1-Bit 91,7
  • Programmierung (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
  • Agentisch/Tool-Nutzung (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
  • Befolgung von Anweisungen (IFEval, IFBench): 78,4 → 71,8 → 65,8
  • Wissen/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
  • Bildverarbeitung (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
  • Gesamt: 85,0 → 80,5 (95% Beibehaltung) → 76,1 (90% Beibehaltung)

Mathematik und Programmierung werden am wenigsten beeinträchtigt – entscheidend für agentische Arbeitslasten. Die 1-Bit-Variante mit 3,9 GB ist kleiner als ein vollpräzises 2B-Modell, bietet aber dennoch Intelligenz der 27B-Klasse.

Warum lokale Ausführung für Agenten wichtig ist

Agentische Arbeitslasten erfordern viele sequenzielle Modellaufrufe – jeder mit Kontext und strukturierter Ausgabe. Reine Cloud-Ausführung bedeutet Verzögerung pro Schritt, ansteigende Token-Kosten und das Senden privater Daten (Screenshots, Dateien) über das Netzwerk. Lokale Ausführung beseitigt diese Einschränkungen. Bonsai 27B ermöglicht geräteinterne mehrschrittige Argumentation, Tool-Aufrufe und computeragentische Schleifen.

Lizenzierung und Verfügbarkeit

Beide Varianten sind ab heute unter der Apache-2.0-Lizenz verfügbar.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

Der Wettlauf um KI an der Grenze ist vorbei: Netzwerke kleinerer Modelle schlagen zentralisierte KI bei Kosten und Leistungsfähigkeit
Nachrichten

Der Wettlauf um KI an der Grenze ist vorbei: Netzwerke kleinerer Modelle schlagen zentralisierte KI bei Kosten und Leistungsfähigkeit

Netzwerke kleinerer KI-Modelle übertreffen jetzt jedes Spitzen-KI-System in Geschwindigkeit, Genauigkeit und Kosten. Der Artikel argumentiert, dass zentralisierte KI-Unternehmen die Führung aufgrund des „Hydra-Effekts“ nicht zurückgewinnen können – das rekursive Kombinieren günstigerer Modelle schlägt jedes einzelne Modell.

OpenClawRadar
Die verborgene Finanzblase in der KI-Infrastruktur – Kernaussagen
Nachrichten

Die verborgene Finanzblase in der KI-Infrastruktur – Kernaussagen

Eine kritische Analyse des Booms bei den Investitionen in KI-Infrastruktur, die vor einer nicht nachhaltigen Blase ähnlich wie bei früheren Technologiecrashs warnt. Das PDF argumentiert, dass die massiven Kapitalausgaben für GPUs und Rechenzentren die tatsächliche Umsatzgenerierung bei weitem übersteigen.

OpenClawRadar
PS3-Emulator-Entwickler bitten Entwickler, keine KI-generierten PRs mehr einzureichen
Nachrichten

PS3-Emulator-Entwickler bitten Entwickler, keine KI-generierten PRs mehr einzureichen

RPCS3-Betreuer haben öffentlich darum gebeten, dass Nutzer aufhören, Pull-Requests einzureichen, die von KI-Code-Agenten erstellt wurden, und begründen dies mit geringer Qualität und hohem Wartungsaufwand.

OpenClawRadar
Entwickler beschreibt Betrugsgefühl nach erstem KI-unterstützten Pull Request
Nachrichten

Entwickler beschreibt Betrugsgefühl nach erstem KI-unterstützten Pull Request

Ein Entwickler nutzte Claude Code, um einen Pull Request für Chroma, Hugos standardmäßigen Syntax-Highlighter, zu erstellen und ERB-Syntax-Highlighting hinzuzufügen. Der PR wurde genehmigt und zusammengeführt, aber der Entwickler fühlte sich wie ein Betrüger und erlebte eine Verschlimmerung seines Hochstapler-Syndroms.

OpenClawRadar