Bonsai 27B: Das erste 27B-Klasse Modell läuft auf einem Smartphone — Benchmark-Werte und Spezifikationen

PrismML hat Bonsai 27B veröffentlicht, das erste Modell der 27-Milliarden-Parameter-Klasse, das auf ein Smartphone passt und dort läuft. Basierend auf Qwen 3.6 27B nutzt es extreme Niedrigbit-Quantisierung – ternäre oder binäre Gewichte – um das Modell auf 3,9 GB (1-Bit-Variante) bzw. 5,9 GB (ternäre Variante) zu schrumpfen, gegenüber 54 GB in 16-Bit-Präzision.
Zwei Varianten: Ternär vs. 1-Bit
- Ternärer Bonsai 27B: Gewichte in {−1, 0, +1} mit FP16-Gruppen-Skalierung, 1,71 effektive Bits pro Gewicht. Größe: 5,9 GB. Zielgruppe: Laptops mit vollständiger Argumentation, Tool-Nutzung und agentischen Fähigkeiten.
- 1-Bit Bonsai 27B: Binäre Gewichte {−1, +1}, 1,125 effektive Bits pro Gewicht. Größe: 3,9 GB. Passt in den Arbeitsspeicher des iPhone 17 Pro.
Beide Varianten führen das gesamte Netzwerk (Embeddings, Attention, MLPs, LM-Head) im Niedrigbit-Modus – ohne höherpräzise Ausweichmechanismen. Sie unterstützen 262K-Token-Kontext, multimodales Sehen (4-Bit-Vision-Tower) und spekulatives Decodieren.
Benchmark-Ergebnisse (Denkmodus)
In einer 15-Benchmark-Suite:
- Mathematik (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3, Ternär 93,4, 1-Bit 91,7
- Programmierung (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
- Agentisch/Tool-Nutzung (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
- Befolgung von Anweisungen (IFEval, IFBench): 78,4 → 71,8 → 65,8
- Wissen/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
- Bildverarbeitung (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
- Gesamt: 85,0 → 80,5 (95% Beibehaltung) → 76,1 (90% Beibehaltung)
Mathematik und Programmierung werden am wenigsten beeinträchtigt – entscheidend für agentische Arbeitslasten. Die 1-Bit-Variante mit 3,9 GB ist kleiner als ein vollpräzises 2B-Modell, bietet aber dennoch Intelligenz der 27B-Klasse.
Warum lokale Ausführung für Agenten wichtig ist
Agentische Arbeitslasten erfordern viele sequenzielle Modellaufrufe – jeder mit Kontext und strukturierter Ausgabe. Reine Cloud-Ausführung bedeutet Verzögerung pro Schritt, ansteigende Token-Kosten und das Senden privater Daten (Screenshots, Dateien) über das Netzwerk. Lokale Ausführung beseitigt diese Einschränkungen. Bonsai 27B ermöglicht geräteinterne mehrschrittige Argumentation, Tool-Aufrufe und computeragentische Schleifen.
Lizenzierung und Verfügbarkeit
Beide Varianten sind ab heute unter der Apache-2.0-Lizenz verfügbar.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Claude Code 2.1.80 fügt Sichtbarkeit für Ratenbegrenzungen, MCP-Push-Nachrichten und Speicherverbesserungen hinzu.
Claude Code Version 2.1.80 führt Sichtbarkeit von Ratenbegrenzungen in der Statusleiste ein, MCP-Push-Nachrichten über das --channels-Flag, Inline-Plugin-Konfiguration und reduziert den Speicherverbrauch um 80 MB beim Start.

Anthropic verdoppelt Claude Code-Ratenlimits, entfernt Spitzen-Drosselung für kostenpflichtige Pläne
Anthropic hat die 5-Stunden-Ratenlimits für Claude Code bei den Plänen Pro, Max, Team und Enterprise verdoppelt, die Drosselung während der Spitzenzeiten aufgehoben und die API-Ratenlimits für Opus-Modelle erhöht.

Die KI-Abhängigkeitsfalle: Warum übermäßiges Vertrauen in LLMs Kernkompetenzen untergraben könnte
Eine kontroverse Meinung, die argumentiert, dass eine starke Abhängigkeit von KI-Chatbots zu einem Verlust von kritischem Denken, Schreib-, Recherche- und Lernfähigkeiten führen wird.

Entwickler-Erfahrung mit Claude AI: Vom Denkpartner zum kognitiven Outsourcing
Ein Entwickler teilt eine 8-monatige Erfahrung mit der täglichen Nutzung von Claude AI und bemerkt einen Wandel: von der Verwendung zur Verfeinerung bestehender Gedanken hin zum vollständigen Auslagern des anfänglichen Denkens. Der Beitrag beschreibt zwei verschiedene kognitive Ansätze: KI als Denkpartner versus KI als Erstentwurfs-Generator.