Bonsai 27B: Das erste 27B-Klasse Modell läuft auf einem Smartphone — Benchmark-Werte und Spezifikationen

PrismML hat Bonsai 27B veröffentlicht, das erste Modell der 27-Milliarden-Parameter-Klasse, das auf ein Smartphone passt und dort läuft. Basierend auf Qwen 3.6 27B nutzt es extreme Niedrigbit-Quantisierung – ternäre oder binäre Gewichte – um das Modell auf 3,9 GB (1-Bit-Variante) bzw. 5,9 GB (ternäre Variante) zu schrumpfen, gegenüber 54 GB in 16-Bit-Präzision.
Zwei Varianten: Ternär vs. 1-Bit
- Ternärer Bonsai 27B: Gewichte in {−1, 0, +1} mit FP16-Gruppen-Skalierung, 1,71 effektive Bits pro Gewicht. Größe: 5,9 GB. Zielgruppe: Laptops mit vollständiger Argumentation, Tool-Nutzung und agentischen Fähigkeiten.
- 1-Bit Bonsai 27B: Binäre Gewichte {−1, +1}, 1,125 effektive Bits pro Gewicht. Größe: 3,9 GB. Passt in den Arbeitsspeicher des iPhone 17 Pro.
Beide Varianten führen das gesamte Netzwerk (Embeddings, Attention, MLPs, LM-Head) im Niedrigbit-Modus – ohne höherpräzise Ausweichmechanismen. Sie unterstützen 262K-Token-Kontext, multimodales Sehen (4-Bit-Vision-Tower) und spekulatives Decodieren.
Benchmark-Ergebnisse (Denkmodus)
In einer 15-Benchmark-Suite:
- Mathematik (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3, Ternär 93,4, 1-Bit 91,7
- Programmierung (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
- Agentisch/Tool-Nutzung (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
- Befolgung von Anweisungen (IFEval, IFBench): 78,4 → 71,8 → 65,8
- Wissen/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
- Bildverarbeitung (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
- Gesamt: 85,0 → 80,5 (95% Beibehaltung) → 76,1 (90% Beibehaltung)
Mathematik und Programmierung werden am wenigsten beeinträchtigt – entscheidend für agentische Arbeitslasten. Die 1-Bit-Variante mit 3,9 GB ist kleiner als ein vollpräzises 2B-Modell, bietet aber dennoch Intelligenz der 27B-Klasse.
Warum lokale Ausführung für Agenten wichtig ist
Agentische Arbeitslasten erfordern viele sequenzielle Modellaufrufe – jeder mit Kontext und strukturierter Ausgabe. Reine Cloud-Ausführung bedeutet Verzögerung pro Schritt, ansteigende Token-Kosten und das Senden privater Daten (Screenshots, Dateien) über das Netzwerk. Lokale Ausführung beseitigt diese Einschränkungen. Bonsai 27B ermöglicht geräteinterne mehrschrittige Argumentation, Tool-Aufrufe und computeragentische Schleifen.
Lizenzierung und Verfügbarkeit
Beide Varianten sind ab heute unter der Apache-2.0-Lizenz verfügbar.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Der Wettlauf um KI an der Grenze ist vorbei: Netzwerke kleinerer Modelle schlagen zentralisierte KI bei Kosten und Leistungsfähigkeit
Netzwerke kleinerer KI-Modelle übertreffen jetzt jedes Spitzen-KI-System in Geschwindigkeit, Genauigkeit und Kosten. Der Artikel argumentiert, dass zentralisierte KI-Unternehmen die Führung aufgrund des „Hydra-Effekts“ nicht zurückgewinnen können – das rekursive Kombinieren günstigerer Modelle schlägt jedes einzelne Modell.

Die verborgene Finanzblase in der KI-Infrastruktur – Kernaussagen
Eine kritische Analyse des Booms bei den Investitionen in KI-Infrastruktur, die vor einer nicht nachhaltigen Blase ähnlich wie bei früheren Technologiecrashs warnt. Das PDF argumentiert, dass die massiven Kapitalausgaben für GPUs und Rechenzentren die tatsächliche Umsatzgenerierung bei weitem übersteigen.

PS3-Emulator-Entwickler bitten Entwickler, keine KI-generierten PRs mehr einzureichen
RPCS3-Betreuer haben öffentlich darum gebeten, dass Nutzer aufhören, Pull-Requests einzureichen, die von KI-Code-Agenten erstellt wurden, und begründen dies mit geringer Qualität und hohem Wartungsaufwand.

Entwickler beschreibt Betrugsgefühl nach erstem KI-unterstützten Pull Request
Ein Entwickler nutzte Claude Code, um einen Pull Request für Chroma, Hugos standardmäßigen Syntax-Highlighter, zu erstellen und ERB-Syntax-Highlighting hinzuzufügen. Der PR wurde genehmigt und zusammengeführt, aber der Entwickler fühlte sich wie ein Betrüger und erlebte eine Verschlimmerung seines Hochstapler-Syndroms.