Benchmark-Ergebnisse für kleine lokale und OpenRouter-Modelle bei agentischer Text-to-SQL-Aufgabe

Ein Entwickler hat Benchmark-Ergebnisse für kleine lokale und OpenRouter-Modelle bei einer agentenbasierten Text-zu-SQL-Aufgabe veröffentlicht. Der Benchmark nimmt englische Abfragen wie "Zeige Bestellpositionen, Umsatz, verkaufte Einheiten, Umsatz pro Einheit (Gesamtumsatz ÷ Gesamtverkaufte Einheiten), durchschnittlichen Listenpreis pro Produkt in der Unterkategorie, Bruttogewinn und Gewinnspanne in Prozent für jede Produktunterkategorie" und wandelt sie in SQL um, das gegen Datenbanktabellen getestet wird.
Benchmark-Details
Der Agent kann Abfrageergebnisse sehen und SQL zur Behebung von Problemen anpassen, mit einer Begrenzung der Debugging-Runden. Der Benchmark ist bewusst kurz mit 25 Fragen und läuft für die meisten Modelle in deutlich weniger als 5 Minuten, was ihn praktisch für das Testen verschiedener Konfigurationen macht. Er ist so konzipiert, dass er hart genug ist, um die besten Modelle von anderen zu unterscheiden.
Wichtige Erkenntnisse
- Die besten Open-Modelle waren kimi-k2.5, Qwen 3.5 397B-A17B und Qwen 3.5 27B
- NVIDIA Nemotron-Cascade-2-30B-A3B übertrifft Qwen 3.5-35B-A3B und entspricht Codex 5.3
- Mimo v2 Flash wurde als "ein Juwel von einem Modell" beschrieben
Selbstgehostete Option
Der Benchmark enthält jetzt die Möglichkeit, ihn selbst gegen Ihren eigenen Server mit der WASM-Version von Llama.cpp auszuführen. Der Entwickler sucht Feedback zu Änderungen für Version 2 und möchte sehen, welche Ergebnisse andere mit verschiedenen Konfigurationen erzielen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Verwandle deine Wissensdatenbank in ein Wiki + MCP-Server für Claude
Eine Demo, wie Akyn eine Wissensdatenbank (URL, PDF, Notion) in ein Wiki verwandelt und als MCP-Server bereitstellt, sodass Claude darin suchen und schreiben kann – mit OAuth, Human-in-the-Loop und automatischer Synchronisierung.

Sitefire automatisiert die KI-Suchoptimierung mit Content Agents.
Die Plattform von Sitefire überwacht KI-Suchergebnisse, analysiert, welche Seiten zitiert werden, und nutzt Content-Agenten, um Verbesserungen zu entwerfen oder neue Seiten zu erstellen, die direkt in das CMS der Kunden übertragen werden. Ein Kunde verzeichnete einen Anstieg der KI-Bot-Anfragen von ~200/Tag auf ~570/Tag innerhalb von zehn Tagen.

Agoragentic: pip-installbarer Agenten-Marktplatz zum Kaufen und Verkaufen von Fähigkeiten
Agoragentic ist ein Agent-zu-Agent-Marktplatz, auf dem KI-Agenten Fähigkeiten anderer Agenten entdecken und aufrufen können über eine pip-installierbare Integration. Der Marktplatz nutzt USDC auf Base L2 für Zahlungen mit einer 3% Plattformgebühr und bietet kostenlose Testguthaben.

Cowork Context Management Kit löst Claudes Dateiüberlastungsproblem
Ein Entwickler erstellte ein Kontextverwaltungskit für Cowork, nachdem Claude KI alle 462 Dateien in ihrem Projektordner las, was zu Leistungsproblemen und Widersprüchen führte. Die Lösung umfasst globale Anweisungen, ein Manifest-Dateisystem und eine Cowork-Fähigkeit, um relevante Dokumente zu priorisieren.