Bonsai 27B: Das erste 27B-Klasse Modell läuft auf einem Smartphone — Benchmark-Werte und Spezifikationen

✍️ OpenClawRadar📅 Veröffentlicht: 15. Juli 2026🔗 Source
Bonsai 27B: Das erste 27B-Klasse Modell läuft auf einem Smartphone — Benchmark-Werte und Spezifikationen
Ad

PrismML hat Bonsai 27B veröffentlicht, das erste Modell der 27-Milliarden-Parameter-Klasse, das auf ein Smartphone passt und dort läuft. Basierend auf Qwen 3.6 27B nutzt es extreme Niedrigbit-Quantisierung – ternäre oder binäre Gewichte – um das Modell auf 3,9 GB (1-Bit-Variante) bzw. 5,9 GB (ternäre Variante) zu schrumpfen, gegenüber 54 GB in 16-Bit-Präzision.

Zwei Varianten: Ternär vs. 1-Bit

  • Ternärer Bonsai 27B: Gewichte in {−1, 0, +1} mit FP16-Gruppen-Skalierung, 1,71 effektive Bits pro Gewicht. Größe: 5,9 GB. Zielgruppe: Laptops mit vollständiger Argumentation, Tool-Nutzung und agentischen Fähigkeiten.
  • 1-Bit Bonsai 27B: Binäre Gewichte {−1, +1}, 1,125 effektive Bits pro Gewicht. Größe: 3,9 GB. Passt in den Arbeitsspeicher des iPhone 17 Pro.

Beide Varianten führen das gesamte Netzwerk (Embeddings, Attention, MLPs, LM-Head) im Niedrigbit-Modus – ohne höherpräzise Ausweichmechanismen. Sie unterstützen 262K-Token-Kontext, multimodales Sehen (4-Bit-Vision-Tower) und spekulatives Decodieren.

Ad

Benchmark-Ergebnisse (Denkmodus)

In einer 15-Benchmark-Suite:

  • Mathematik (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3, Ternär 93,4, 1-Bit 91,7
  • Programmierung (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
  • Agentisch/Tool-Nutzung (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
  • Befolgung von Anweisungen (IFEval, IFBench): 78,4 → 71,8 → 65,8
  • Wissen/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
  • Bildverarbeitung (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
  • Gesamt: 85,0 → 80,5 (95% Beibehaltung) → 76,1 (90% Beibehaltung)

Mathematik und Programmierung werden am wenigsten beeinträchtigt – entscheidend für agentische Arbeitslasten. Die 1-Bit-Variante mit 3,9 GB ist kleiner als ein vollpräzises 2B-Modell, bietet aber dennoch Intelligenz der 27B-Klasse.

Warum lokale Ausführung für Agenten wichtig ist

Agentische Arbeitslasten erfordern viele sequenzielle Modellaufrufe – jeder mit Kontext und strukturierter Ausgabe. Reine Cloud-Ausführung bedeutet Verzögerung pro Schritt, ansteigende Token-Kosten und das Senden privater Daten (Screenshots, Dateien) über das Netzwerk. Lokale Ausführung beseitigt diese Einschränkungen. Bonsai 27B ermöglicht geräteinterne mehrschrittige Argumentation, Tool-Aufrufe und computeragentische Schleifen.

Lizenzierung und Verfügbarkeit

Beide Varianten sind ab heute unter der Apache-2.0-Lizenz verfügbar.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

Claude Code Systemprompt-Montage und Struktur enthüllt
Nachrichten

Claude Code Systemprompt-Montage und Struktur enthüllt

Ein Source-Map-Leck im npm-Paket von Claude Code legte den System-Prompt-Erstellungsprozess offen, der statische Präfixabschnitte gefolgt von dynamischen, sitzungsspezifischen Inhalten zeigt, mit drei Identitätsvarianten und detaillierten Ausführungsrichtlinien.

OpenClawRadar
OpenClaw Diskussion über KI-Agent-zu-Agent-Kommunikation und Kontextfreigabe
Nachrichten

OpenClaw Diskussion über KI-Agent-zu-Agent-Kommunikation und Kontextfreigabe

Eine Reddit-Diskussion untersucht die Implikationen von KI-Agenten, die persönlichen Kontext nutzen, um im Namen eines Nutzers mit anderen Agenten zu kommunizieren, und beleuchtet, welche Informationen Nutzer bereit wären zu teilen.

OpenClawRadar
OpenClaw 2026.3.22 Update: Nützliche Funktionen, aber drei kritische Probleme erfordern Vorsicht
Nachrichten

OpenClaw 2026.3.22 Update: Nützliche Funktionen, aber drei kritische Probleme erfordern Vorsicht

Das OpenClaw-Update 2026.3.22 führt nützliche Funktionen wie den /btw-Befehl, die Konfigurierbarkeit des Gesundheitsmonitors, die Telegram-Antwortkorrektur und Standardwerte für die pro-Agenten-Logik ein, aber drei offene Probleme (#53158, #53202, #53195) machen eine sofortige Bereitstellung ohne Überwachung riskant.

OpenClawRadar
Gemma 4 Frühe Signale: Praxistauglichkeit vor Hype für lokale Agenten-Workflows
Nachrichten

Gemma 4 Frühe Signale: Praxistauglichkeit vor Hype für lokale Agenten-Workflows

Der Start von Gemma 4 betont die Bereitstellung über Hardware-Ebenen hinweg mit offizieller Positionierung für persönliche Hardware und Edge/Mobile, wobei NVIDIAs NVFP4-Quantisierung eine 4-fache Komprimierung mit 99,7 % Basislinienbeibehaltung auf GPQA zeigt, und Arena-Ranglisten platzieren das 31B-Dichtemodell um Platz #27.

OpenClawRadar