Gemma 4 31B übertrifft größere Modelle auf dem FoodTruck Bench.

✍️ OpenClawRadar📅 Veröffentlicht: 21. April 2026🔗 Source
Gemma 4 31B übertrifft größere Modelle auf dem FoodTruck Bench.
Ad
Ad

Benchmark-Ergebnisse und Analyse

Gemma 4 31B erreichte den 3. Platz beim FoodTruck Bench Benchmark und übertraf dabei mehrere größere und etabliertere Modelle. Laut der Reddit-Diskussion schlug das Modell GLM 5, Qwen 3.5 397B und alle Claude Sonnet-Varianten.

Der FoodTruck Bench ist ein Benchmark, der Sprachmodelle an komplexen, mehrstufigen Planungsaufgaben testet. Der ursprüngliche Beitrag spekuliert, dass Gemma 4s Leistung darauf hindeutet, dass es langfristige Aufgaben besser bewältigt als frühere Modelle, die den Benchmark nicht abschließen konnten. Insbesondere scheint das Modell effektiv auf seine eigenen Ratschläge zu hören, wenn es die nachfolgenden Schritte in der Aufgabenabfolge plant.

Dieses Ergebnis ist bemerkenswert, weil Gemma 4 31B deutlich kleiner ist als einige der Modelle, die es übertroffen hat. Qwen 3.5 397B hat beispielsweise etwa 12,8-mal mehr Parameter als Gemma 4 31B. Die Leistung deutet darauf hin, dass Modellarchitektur und Trainingsansätze für bestimmte Arten von Denkaufgaben ebenso wichtig sein könnten wie die Parameteranzahl.

Der FoodTruck Bench testet Modelle an praktischen Planungsszenarien, die die Aufrechterhaltung des Kontexts über längere Aktionssequenzen erfordern. Das Design des Benchmarks macht ihn besonders relevant für Entwickler, die mit KI-Agenten arbeiten, die mehrstufige Aufgaben in realen Anwendungen ausführen müssen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude-Code v2.1.84 fügt PowerShell-Tool, Umgebungsvariablen und mehrere Fehlerbehebungen hinzu
Nachrichten

Claude-Code v2.1.84 fügt PowerShell-Tool, Umgebungsvariablen und mehrere Fehlerbehebungen hinzu

Claude-Code v2.1.84 stellt ein PowerShell-Tool für Windows als Opt-in-Vorschau vor, fügt Umgebungsvariablen für Modellkonfiguration und Streaming-Timeout hinzu und enthält zahlreiche Fehlerbehebungen und Leistungsverbesserungen.

OpenClawRadar
Wöchentlicher Multimodaler KI-Rundblick: Holotron-12B, Nemotron Omni, GlyphPrinter und mehr
Nachrichten

Wöchentlicher Multimodaler KI-Rundblick: Holotron-12B, Nemotron Omni, GlyphPrinter und mehr

Die Highlights der multimodalen KI dieser Woche umfassen Holotron-12B für Computer-Nutzungsaufgaben, NVIDIAs Nemotron Omni-Modelle, die Sprache, Bild und Stimme integrieren, GlyphPrinter für präzise Textdarstellung in der Bildgenerierung sowie mehrere Open-Source-Projekte für Videoverbesserung, 3D-Segmentierung und Multi-Agenten-Systeme.

OpenClawRadar
Anthropic-Bericht beschreibt Massen-Distillation von Claude durch chinesische KI-Firmen
Nachrichten

Anthropic-Bericht beschreibt Massen-Distillation von Claude durch chinesische KI-Firmen

Anthropic veröffentlichte Beweise, dass DeepSeek, Moonshot AI und MiniMax 24.000 gefälschte Konten und über 16 Millionen Austausche nutzten, um Claudes Fähigkeiten zu destillieren, wodurch Sicherheitsmechanismen in den kopierten Modellen beeinträchtigt wurden.

OpenClawRadar
Illinois verabschiedet SB 315: Drittanbieter-Audits für Frontier-KI-Labore erforderlich
Nachrichten

Illinois verabschiedet SB 315: Drittanbieter-Audits für Frontier-KI-Labore erforderlich

Illinois verabschiedet SB 315, das KI-Labore wie OpenAI, Anthropic und Google DeepMind zu Sicherheitsaudits durch unabhängige Dritte verpflichtet. Nach Unterzeichnung wäre es das strengste US-Bundesstaatgesetz zur KI-Sicherheit.

OpenClawRadar