Gemma-4 26B-A4B mit Opencode läuft effizient auf dem M5 MacBook Air

Ein Entwickler testete Gemma-4-26B-A4B mit Opencode auf einem 32GB M5 MacBook Air und stellte fest, dass es praktische Leistung für lokale KI-Codierungsaufgaben bietet.
Leistungsbenchmarks
Die getestete spezifische Konfiguration war gemma-4-26B-A4B-it-UD-IQ4_XS, die auf einem 32GB M5 MacBook Air läuft. Im Energiesparmodus erreichte sie:
- 300 Token/Sekunde bei der Eingabeverarbeitung
- 12 Token/Sekunde bei der Generierung
- 8W Stromverbrauch
- Keine Wärme oder Lüftergeräusche während des Betriebs
Das M5 MacBook Air zeigte deutliche Verbesserungen gegenüber früherer Hardware:
- ~25 % schnellere Eingabeverarbeitung als ein M1 Max 64GB (selbst wenn der Max nicht im Energiesparmodus war)
- ~6 Stunden Akkulaufzeit gegenüber ~2 Stunden beim M1 Max beim Ausführen von Opencode
- Dies trotz eines kleineren Akkus (53,8 Wh gegenüber 70 Wh beim M1 Max)
Praktische Anwendungsfälle
Der Entwickler fand dieses Setup „tatsächlich nutzbar“ für agentisches Codierverhalten von einem Laptop aus. Zuvor war das Ausführen von LLMs auf einem M1 Max 64GB auf „Herumspielen und Spielzeug-Anwendungsfälle“ beschränkt und konnte längere Kontextaufgaben nicht effektiv bewältigen. Während es ein einfaches Snake-Spiel in Python erstellen konnte, war agentisches Codieren oder das Beitragen zu größeren Codebasen „etwas hakelig“.
Die Leistung des M5 macht es für mobile Anwendungsfälle praktikabel, in denen die Internetverbindung unzuverlässig sein könnte, wie in Cafés oder während Zugpendelverkehr.
Vergleich mit anderen Modellen
Der Entwickler verglich Gemma-4-26B mit Opencode mit Closed-Source-Alternativen:
- Es ersetzt Claude Code oder Antigravity laut ihren Tests nicht
- Gemma-4 erfordert „deutlich mehr Handhalten als aktuelle Closed-Source-Frontiermodelle“
- Die Antworten werden als „irgendwie trocken“ im Vergleich zu Claude Code oder Gemini-3.1-Pro mit Antigravity beschrieben
- Sie würden jedoch Gemma-4-26B vorziehen, anstatt ihr Gemini-2.5-Pro-Kontingent aufzubrauchen und gezwungen zu sein, Gemini-2.5-Flash zu verwenden
Der Entwickler merkt an, dass dies einen bedeutenden Fortschritt darstellt, da „diese Art von agentischem Codieren Ende 2024 bei Frontiermodellen noch Spitzentechnik / nicht wirklich möglich war.“
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Engram: Ein Lern-Plugin für OpenClaw, das Wissen tatsächlich haften lässt
Engram ist ein OpenClaw-Plugin, das neurowissenschaftliche Techniken wie Pre-Testing, Blind Grading und FSRS-4.5-Planung nutzt, um sicherzustellen, dass das Gelernte hängen bleibt – selbst wenn KI-Agenten die Arbeit beschleunigen.

Silos-Dashboard: Open-Source-Web-UI zur Verwaltung von OpenClaw-Agenten
Silos Dashboard ist eine MIT-lizenzierte Web-UI zur Verwaltung von OpenClaw-Agenten, die Konfigurationsdateien und die CLI durch eine einzige Oberfläche ersetzt. Sie bietet Agentenverwaltung, Live-Chat mit Streaming, Skill-Installation, Task-Boards, Kanal-Integrationen und Analysen.

Krasis: Hybride CPU/GPU-Laufzeitumgebung für große MoE-Modelle erreicht 3.324 Tok/s Prefill auf RTX 5080
Krasis ist eine hybride CPU/GPU-Laufzeitumgebung, die große MoE-Modelle ausführt, indem sie die Vorausfüllung auf der GPU und die Dekodierung auf der CPU verarbeitet. Sie erreicht 3.324 Token/Sekunde bei der Vorausfüllung auf einer RTX 5080 mit Qwen3-Coder-Next 80B Q4. Sie benötigt etwa das 2,5-fache der Modellgröße im System-RAM, ermöglicht aber die Ausführung von Modellen, die für den VRAM zu groß sind.

Clawion: OpenClaw-Wrapper mit Claude Max-Unterstützung und GitHub-Integration
Clawion ist ein OpenClaw-Wrapper, der Claude Max unterstützt, ohne dass ein API-Schlüssel erforderlich ist. Die Einrichtung umfasst die Auswahl einer Vorlage, die Verbindung von Telegram und die Bereitstellung eines Code-Begleiters mit GitHub-Integration für die automatisierte Erstellung von Pull-Requests.