Gemma 4 31B übertrifft größere Modelle auf dem FoodTruck Bench.

✍️ OpenClawRadar📅 Veröffentlicht: 21. April 2026🔗 Source
Gemma 4 31B übertrifft größere Modelle auf dem FoodTruck Bench.
Ad
Ad

Benchmark-Ergebnisse und Analyse

Gemma 4 31B erreichte den 3. Platz beim FoodTruck Bench Benchmark und übertraf dabei mehrere größere und etabliertere Modelle. Laut der Reddit-Diskussion schlug das Modell GLM 5, Qwen 3.5 397B und alle Claude Sonnet-Varianten.

Der FoodTruck Bench ist ein Benchmark, der Sprachmodelle an komplexen, mehrstufigen Planungsaufgaben testet. Der ursprüngliche Beitrag spekuliert, dass Gemma 4s Leistung darauf hindeutet, dass es langfristige Aufgaben besser bewältigt als frühere Modelle, die den Benchmark nicht abschließen konnten. Insbesondere scheint das Modell effektiv auf seine eigenen Ratschläge zu hören, wenn es die nachfolgenden Schritte in der Aufgabenabfolge plant.

Dieses Ergebnis ist bemerkenswert, weil Gemma 4 31B deutlich kleiner ist als einige der Modelle, die es übertroffen hat. Qwen 3.5 397B hat beispielsweise etwa 12,8-mal mehr Parameter als Gemma 4 31B. Die Leistung deutet darauf hin, dass Modellarchitektur und Trainingsansätze für bestimmte Arten von Denkaufgaben ebenso wichtig sein könnten wie die Parameteranzahl.

Der FoodTruck Bench testet Modelle an praktischen Planungsszenarien, die die Aufrechterhaltung des Kontexts über längere Aktionssequenzen erfordern. Das Design des Benchmarks macht ihn besonders relevant für Entwickler, die mit KI-Agenten arbeiten, die mehrstufige Aufgaben in realen Anwendungen ausführen müssen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Apple Silicon Benchmark: Leistung von Qwen3-VL auf M3, M4 und M5 Max für Vision-LLM-Klassifizierung
Nachrichten

Apple Silicon Benchmark: Leistung von Qwen3-VL auf M3, M4 und M5 Max für Vision-LLM-Klassifizierung

Benchmark-Ergebnisse zeigen die Klassifizierungsleistung des Qwen3-VL Vision-LLM auf Apple Silicon: M3 Max und M4 Studio sind bei 8B-Modellen nahezu identisch, während der M5 Max 75-83 % schneller ist. Die Speicherbandbreite ist für die Token-Generierung wichtiger als für das Prefill bei Vision-Aufgaben.

OpenClawRadar
Claude Opus 4.6 Gedächtnisausfall: Agent vergisst alles außer Dateiumbenennung
Nachrichten

Claude Opus 4.6 Gedächtnisausfall: Agent vergisst alles außer Dateiumbenennung

Ein Entwickler dokumentiert die 228 Logeinträge, 95 Agentenaktionen und 38 Codeausführungen von Claude Opus 4.6, die nur einen Speicher produzierten: die Zeichenfolge „Agent Zero Tune-Up“.

OpenClawRadar
Claude Code v2.1.121: MCP alwaysLoad, Plugin-Prune, Terminal-Scroll-Fixes und Patches für Speicherlecks
Nachrichten

Claude Code v2.1.121: MCP alwaysLoad, Plugin-Prune, Terminal-Scroll-Fixes und Patches für Speicherlecks

Claude Code v2.1.121 fügt alwaysLoad für MCP-Server, einen Plugin-Prune-Befehl, Type-to-Filter /skills, PostToolUse-Ausgabeersetzung, Terminal-Scroll- und URL-Fixes sowie mehrere Speicherleckbehebungen hinzu, darunter multi-GB RSS-Wachstum bei vielen Bildern.

OpenClawRadar
Claude Code v2.1.133: Worktree.baseRef-Rücknahme, Sandbox-Pfade, Proxy-Fix für MCP OAuth
Nachrichten

Claude Code v2.1.133: Worktree.baseRef-Rücknahme, Sandbox-Pfade, Proxy-Fix für MCP OAuth

Anthropic veröffentlicht v2.1.133 des Claude Code CLI mit einer neuen worktree.baseRef-Einstellung, die standardmäßig fresh (Branch von origin/default) verwendet, sandbox.bwrapPath und sandbox.socatPath für benutzerdefinierte bubblewrap/socat-Binärdateien, einen Proxy/mTLS-Fix für den MCP-OAuth-Ablauf und mehrere Fehlerbehebungen.

OpenClawRadar