Gemma 4 veröffentlicht: Vier Modellgrößen für lokales KI-Hosting

✍️ OpenClawRadar📅 Veröffentlicht: 6. April 2026🔗 Source
Gemma 4 veröffentlicht: Vier Modellgrößen für lokales KI-Hosting
Ad

Gemma 4 Modellspezifikationen

Gemma 4 ist jetzt als selbst gehostetes KI-Modell mit vier verschiedenen Konfigurationen für unterschiedliche Hardware-Szenarien verfügbar. Laut der Quelle konkurriert es nicht mit Claude, Codex oder Gemini, sondern positioniert sich als praktische Option für Multi-Routing-Szenarien, in denen ein kleines, leistungsfähiges, selbst gehostetes Modell Tokens sparen kann.

Modellvarianten und Hardwareanforderungen

  • E2B (2,3 Milliarden effektive Parameter): Entwickelt für Edge-Geräte wie Smartphones und Raspberry Pi. Benötigt ~4-8 GB RAM und läuft gut auf einer CPU. Empfohlen für das Hosting auf VPS.
  • E4B (4,5 Milliarden effektive Parameter): Entwickelt für Laptops und Low-End-Hardware. Behält einen geringen Speicherbedarf bei.
  • 26B MoE (25 Milliarden gesamt, 3,8 Milliarden aktiv): Entwickelt für Consumer-GPUs. Läuft mit Inferenzgeschwindigkeiten ähnlich einem 4B-Modell.
  • 31B Dense: Entwickelt für Mittelklasse-GPUs und Workstations. Benötigt etwa 16-20 GB VRAM bei Verwendung von 4-Bit-Quantisierung.
Ad

Fähigkeiten und Verfügbarkeit

Alle Gemma 4-Modelle sind multimodal mit Text- und Bildverarbeitungsfähigkeiten. Die E2B- und E4B-Edge-Modelle unterstützen speziell Echtzeit-Audio. Die Modelle sind für fortschrittliches Denken und agentenbasierte Workflows konzipiert.

Gemma 4 ist auf Google AI Studio, Hugging Face, Kaggle und Ollama verfügbar.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Gemma 4 Frühe Signale: Praxistauglichkeit vor Hype für lokale Agenten-Workflows
Nachrichten

Gemma 4 Frühe Signale: Praxistauglichkeit vor Hype für lokale Agenten-Workflows

Der Start von Gemma 4 betont die Bereitstellung über Hardware-Ebenen hinweg mit offizieller Positionierung für persönliche Hardware und Edge/Mobile, wobei NVIDIAs NVFP4-Quantisierung eine 4-fache Komprimierung mit 99,7 % Basislinienbeibehaltung auf GPQA zeigt, und Arena-Ranglisten platzieren das 31B-Dichtemodell um Platz #27.

OpenClawRadar
OpenClaw Diskussion über KI-Agent-zu-Agent-Kommunikation und Kontextfreigabe
Nachrichten

OpenClaw Diskussion über KI-Agent-zu-Agent-Kommunikation und Kontextfreigabe

Eine Reddit-Diskussion untersucht die Implikationen von KI-Agenten, die persönlichen Kontext nutzen, um im Namen eines Nutzers mit anderen Agenten zu kommunizieren, und beleuchtet, welche Informationen Nutzer bereit wären zu teilen.

OpenClawRadar
Mercury 2: Diffusionsbasiertes Modell für Echtzeit-KI-Codierung
Nachrichten

Mercury 2: Diffusionsbasiertes Modell für Echtzeit-KI-Codierung

Mercury 2 nutzt diffusionsbasierte Generierung anstelle sequentieller Token-für-Token-Dekodierung, generiert Token parallel und verfeinert sie über mehrere Schritte und beansprucht 1.009 Token/Sekunde auf NVIDIA Blackwell GPUs mit Preisen von 0,25 USD/1 Mio. Eingabe-Token und 0,75 USD/1 Mio. Ausgabe-Token.

OpenClawRadar
Aufmerksamkeitssteuerung: Die Herausforderung des selektiven Vergessens in KI-Gedächtnissystemen
Nachrichten

Aufmerksamkeitssteuerung: Die Herausforderung des selektiven Vergessens in KI-Gedächtnissystemen

Ein Entwickler, der ein fünfschichtiges Speichersystem für einen OpenClaw-Bot erstellt, identifiziert eine zentrale Einschränkung: Aktuelle Ansätze konzentrieren sich auf das Abrufen von Erinnerungen, verfügen aber nicht über Mechanismen, um irrelevante Informationen während fokussierter Aufgaben zu unterdrücken – ähnlich der menschlichen Aufmerksamkeitssteuerung.

OpenClawRadar