Gemma-4 26B-A4B mit Opencode läuft effizient auf dem M5 MacBook Air

✍️ OpenClawRadar📅 Veröffentlicht: 14. April 2026🔗 Source
Gemma-4 26B-A4B mit Opencode läuft effizient auf dem M5 MacBook Air
Ad

Ein Entwickler testete Gemma-4-26B-A4B mit Opencode auf einem 32GB M5 MacBook Air und stellte fest, dass es praktische Leistung für lokale KI-Codierungsaufgaben bietet.

Leistungsbenchmarks

Die getestete spezifische Konfiguration war gemma-4-26B-A4B-it-UD-IQ4_XS, die auf einem 32GB M5 MacBook Air läuft. Im Energiesparmodus erreichte sie:

  • 300 Token/Sekunde bei der Eingabeverarbeitung
  • 12 Token/Sekunde bei der Generierung
  • 8W Stromverbrauch
  • Keine Wärme oder Lüftergeräusche während des Betriebs

Das M5 MacBook Air zeigte deutliche Verbesserungen gegenüber früherer Hardware:

  • ~25 % schnellere Eingabeverarbeitung als ein M1 Max 64GB (selbst wenn der Max nicht im Energiesparmodus war)
  • ~6 Stunden Akkulaufzeit gegenüber ~2 Stunden beim M1 Max beim Ausführen von Opencode
  • Dies trotz eines kleineren Akkus (53,8 Wh gegenüber 70 Wh beim M1 Max)

Praktische Anwendungsfälle

Der Entwickler fand dieses Setup „tatsächlich nutzbar“ für agentisches Codierverhalten von einem Laptop aus. Zuvor war das Ausführen von LLMs auf einem M1 Max 64GB auf „Herumspielen und Spielzeug-Anwendungsfälle“ beschränkt und konnte längere Kontextaufgaben nicht effektiv bewältigen. Während es ein einfaches Snake-Spiel in Python erstellen konnte, war agentisches Codieren oder das Beitragen zu größeren Codebasen „etwas hakelig“.

Die Leistung des M5 macht es für mobile Anwendungsfälle praktikabel, in denen die Internetverbindung unzuverlässig sein könnte, wie in Cafés oder während Zugpendelverkehr.

Ad

Vergleich mit anderen Modellen

Der Entwickler verglich Gemma-4-26B mit Opencode mit Closed-Source-Alternativen:

  • Es ersetzt Claude Code oder Antigravity laut ihren Tests nicht
  • Gemma-4 erfordert „deutlich mehr Handhalten als aktuelle Closed-Source-Frontiermodelle“
  • Die Antworten werden als „irgendwie trocken“ im Vergleich zu Claude Code oder Gemini-3.1-Pro mit Antigravity beschrieben
  • Sie würden jedoch Gemma-4-26B vorziehen, anstatt ihr Gemini-2.5-Pro-Kontingent aufzubrauchen und gezwungen zu sein, Gemini-2.5-Flash zu verwenden

Der Entwickler merkt an, dass dies einen bedeutenden Fortschritt darstellt, da „diese Art von agentischem Codieren Ende 2024 bei Frontiermodellen noch Spitzentechnik / nicht wirklich möglich war.“

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Fünf kostenlose Claude Desktop-Erweiterungen veröffentlicht: Inspector Lite, Graph Lite, Bible Code, Word Graph und Fun Pack
Werkzeuge

Fünf kostenlose Claude Desktop-Erweiterungen veröffentlicht: Inspector Lite, Graph Lite, Bible Code, Word Graph und Fun Pack

Ein Entwickler hat fünf lokale Claude Desktop-Erweiterungen quelloffen gemacht: Inspector Lite für semantische Codesuche, Graph Lite für ein persönliches Wissensnetz, Fun Pack für Unterhaltungsfunktionen, Word Graph für Bibelstudium und Bible Code für Mustererkennung. Alle laufen lokal ohne externe Abhängigkeiten oder zusätzliche API-Schlüssel.

OpenClawRadar
Flotilla v0.5.0 überarbeitet die Hintergrundausführung, um die Kreditlimits des Claude SDK zu umgehen
Werkzeuge

Flotilla v0.5.0 überarbeitet die Hintergrundausführung, um die Kreditlimits des Claude SDK zu umgehen

Flotilla v0.5.0 ersetzt die sequenzielle Agentenausführung durch nicht-blockierende parallele Schleifen, 30-minütige Zeitlimits pro Agent und lokale Delegierung, um SDK-Guthaben zu sparen.

OpenClawRadar
Blackwell LLM Toolkit: NVFP4-Konfigurationen, Räder und Benchmarks für TensorRT-LLM auf RTX Pro 6000
Werkzeuge

Blackwell LLM Toolkit: NVFP4-Konfigurationen, Räder und Benchmarks für TensorRT-LLM auf RTX Pro 6000

Ein Community-Repository bietet TensorRT-LLM-Konfigurationen, vorgebaute LMCache-Räder mit sm_120-Unterstützung und Benchmarks für Blackwell-GPUs. Nemotron-3-Nano-Omni V3 erreicht 270 tok/s bei 8k Kontext auf einer einzelnen RTX Pro 6000.

OpenClawRadar
🦀
Werkzeuge

Needle: Ein Tool-Calling-Modell mit 26 Millionen Parametern, vollständig ohne FFNs aufgebaut

Needle ist ein 26M-Parameter-Modell für Funktionsaufrufe ohne MLPs, das auf Endgeräten 6000 tok/s Prefill und 1200 tok/s Decode erreicht. Es schlägt FunctionGemma-270M, Qwen-0.6B, Granite-350M und LFM2.5-350M beim einmaligen Tool-Aufruf.

OpenClawRadar