Google Gemma 4 26B-A4B lokal mit LM Studio 0.4.0 Headless CLI ausführen

✍️ OpenClawRadar📅 Veröffentlicht: 15. April 2026🔗 Source
Google Gemma 4 26B-A4B lokal mit LM Studio 0.4.0 Headless CLI ausführen
Ad

Was LM Studio 0.4.0 für lokale KI hinzufügt

LM Studio 0.4.0 verändert die Architektur grundlegend, indem die Kerninferenz-Engine in llmster extrahiert wird, einen eigenständigen Server. Dies ermöglicht das Ausführen von LM Studio vollständig über die Befehlszeile mit der neuen lms CLI, wodurch die GUI überflüssig wird. Das Update macht es auf Servern ohne Benutzeroberfläche, in CI/CD-Pipelines, SSH-Sitzungen oder für terminalorientierte Entwickler nutzbar.

Wichtige Funktionen in 0.4.0

  • llmster-Daemon: Ein Hintergrunddienst, der Modellladung und Inferenz ohne Desktop-App verwaltet
  • lms CLI: Vollständige Befehlszeilenschnittstelle zum Herunterladen, Laden, Chatten und Bereitstellen von Modellen
  • Parallele Anfrageverarbeitung: Kontinuierliches Batching statt sequenzieller Warteschlangen, sodass mehrere Anfragen an dasselbe Modell gleichzeitig laufen können
  • Statusbehaftete REST-API: Ein neuer /v1/chat-Endpunkt, der die Konversationshistorie über Anfragen hinweg beibehält
  • MCP-Integration: Lokale Model Context Protocol-Unterstützung mit Berechtigungsschlüssel-Steuerung
Ad

Warum Gemma 4 26B-A4B für lokale Nutzung

Googles Gemma 4 26B-A4B verwendet eine Mixture-of-Experts-Architektur mit 128 Experten plus 1 geteiltem Experten, aktiviert aber nur 8 Experten (3,8 Milliarden Parameter) pro Token. Das bedeutet, es läuft gut auf Hardware, die kein dichtes 26-Milliarden-Modell bewältigen könnte. Auf einem 14" MacBook Pro M4 Pro mit 48 GB vereinheitlichtem Speicher passt es bequem und generiert mit 51 Token/Sekunde.

Das Modell erzielt 82,6 % bei MMLU Pro und 88,3 % bei AIME 2026, nahe an der dichten 31-Milliarden-Variante (85,2 % und 89,2 %), während es deutlich schneller läuft. Es erreicht einen Elo-Score von ~1441 und konkurriert mit Modellen wie Qwen 3.5 397B-A17B (~1450 Elo), die 100–600 Milliarden Gesamtparameter benötigen.

Wichtige Fähigkeiten umfassen 256K maximalen Kontext, Vision-Unterstützung zur Analyse von Screenshots und Diagrammen, native Funktions-/Tool-Aufrufe und Denken mit konfigurierbaren Denkmodi.

Praktische Einrichtung

Der Artikel führt durch die Installation der lms CLI und die Einrichtung von Gemma 4 26B-A4B für lokale Inferenz, die mit Claude Code verwendet werden kann. Der Autor bemerkt aus seiner Erfahrung erhebliche Verlangsamungen bei der Nutzung innerhalb von Claude Code.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

FlowBoard v5: Ereignisgestützter Projektarbeitsplatz für Multi-Agenten-Teams
Werkzeuge

FlowBoard v5: Ereignisgestützter Projektarbeitsplatz für Multi-Agenten-Teams

FlowBoard v5 baut die Projektkontext-Ebene mit React und einem ereignisgesteuerten Task-Store neu auf, ermöglicht Multi-Agent-Koordination über OpenClaw, Claude Code und Cursor und führt eine Ideas-to-Specs-Pipeline ein.

OpenClawRadar
Werld: Offene künstliche Lebenssimulation mit sich entwickelnden neuronalen Netzen
Werkzeuge

Werld: Offene künstliche Lebenssimulation mit sich entwickelnden neuronalen Netzen

Werld ist eine Echtzeit-Simulation künstlichen Lebens, bei der Agenten mit NEAT-Neuronalen Netzen ihre eigene neuronale Architektur, sensorische Verarbeitung und Verhaltensweisen entwickeln, ohne fest kodierte Regeln oder Belohnungsfunktionen. Die Simulation beginnt mit 30 Agenten auf einem Watts-Strogatz-Kleinstwelt-Graphen mit 64 sensorischen Kanälen, 7 kontinuierlichen Motorfunktionen und 29 vererbbaren Genommerkmalen.

OpenClawRadar
AgentPeek: Open-Source-Dashboard zur Überwachung von Claude-Code-Agent-Teams
Werkzeuge

AgentPeek: Open-Source-Dashboard zur Überwachung von Claude-Code-Agent-Teams

AgentPeek ist ein lokales Dashboard, das sich in Claude Code einhakt, um Einblicke in Agententeams zu bieten, die Orchestrierungshierarchien, Ausführungsverläufe, Tokenkosten und Dateioperationen anzeigen. Die Installation erfordert das Klonen des GitHub-Repos und das Ausführen von pipx install.

OpenClawRadar
RelayCode VS Code Extension leitet Claude-Code über souveräne RDUs weiter
Werkzeuge

RelayCode VS Code Extension leitet Claude-Code über souveräne RDUs weiter

OpenGPU hat RelayCode veröffentlicht, eine VS Code-Erweiterung, die als lokaler Proxy fungiert, um Claude Code- oder Copilot-Anfragen über ihr dezentrales Netzwerk zu Open-Weight-Modellen wie DeepSeek-R1 und MiniMax M2.5 weiterzuleiten, die auf souveränen rekonfigurierbaren Dataflow-Einheiten laufen.

OpenClawRadar