mistral.rs unterstützt jetzt Gemma 4 12B: multimodal, agentisch und MTP

mistral.rs unterstützt jetzt Gemma 4 12B mit multimodalen, agentischen und Multi-Turn Prediction (MTP)-Funktionen. Dieses Release beinhaltet Websuche und sandboxierte Codeausführung für den Bau agentischer Apps sowie Audio-, Bild- und Videoeingabe.
Installation
Einzeilige Installation für Linux/macOS und Windows:
# Linux/macOS
curl --proto '=https' --tlsv1.2 -sSf https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.sh | sh
Windows
irm https://raw.githubusercontent.com/EricLBuehler/mistral.rs/master/install.ps1 | iex
Ausführung mit Agent und Quantisierung
Starten Sie einen OpenAI- und Anthropic-kompatiblen HTTP-Server mit integrierter Web-UI unter localhost:1234/ui:
mistralrs run --agent -m google/gemma-4-12B-it --quant 4Aktivieren von MTP (Multi-Turn Prediction)
Um MTP zu nutzen, fügen Sie das Flag --mtp-model mit dem Assistant-Modell hinzu:
mistralrs run --agent -m google/gemma-4-12B-it --quant 4 --mtp-model google/gemma-4-12B-it-assistantHauptfunktionen
- Volle multimodale Unterstützung: Audio, Bild und Video
- Websuche und sandboxierte Codeausführung für agentische Workflows
- OpenAI- und Anthropic-kompatibler HTTP-Server
- Integrierte Web-Chat-UI unter
localhost:1234/ui
Weitere Details: GitHub | Dokumentation
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Vergleich von OpenClaw und Claude Cowork: Lokale Automatisierung vs. Sandbox-Workflows
OpenClaw ist ein ständig aktiver lokaler Agent, der auf Ihrem Computer mit Shell-Befehlausführung und Browser-Automatisierung läuft, während Claude Cowork innerhalb von Claude Desktop in einer abgeschotteten Umgebung arbeitet, die sich auf Dokument- und Browser-Aufgaben konzentriert.

Gemini 3.1 Pro in Multi-Agenten-Systemen: Hohe Designqualität, 20% Fehlerrate bei Tool-Aufrufen
Entwickler, die Bobr, einen KI-Präsentationsgenerator mit einer Multi-Agenten-Architektur erstellen, berichten, dass Gemini 3.1 Pro beeindruckende Design-Ergebnisse liefert, aber unter einer Ausfallrate von Werkzeugaufrufen von ~20 % und verstümmelter Textkorruption in Produktions-Pipelines leidet.

Kostenloser Claude-Session-Optimierer: Token-Schätzer, Prompt-Komprimierer und Session-Planer
Ein Entwickler hat ein kostenloses Tool ohne Anmeldung erstellt, um die Nutzungsgrenzen von Claude zu verwalten, mit drei Funktionen: einem Token-Schätzer zur Vorschau des Prompt-Verbrauchs, einem Prompt-Komprimierer, der Prompts durch Entfernen von Füllphrasen um 40-60% reduziert, und einem Sitzungsplaner, der Aufgaben gruppiert, um das Neuladen des Kontexts zu minimieren.

Gemma4 26B-A4B bietet schnelle lokale Leistung mit Web-Suche und Bildunterstützung
Das Gemma-4-26B-A4B-Modell erreicht etwa 145 Tokens pro Sekunde auf einer RTX 4090 und umfasst Web-Suche-MCP sowie Bildunterstützung für Chat-Anwendungen. Ein Blogbeitrag erläutert die Einrichtung und plattformübergreifende Nutzung auf Mac und iPhone.