Lokaler LLM-Benchmark: Backend-Generierung durch Funktionsaufruf – GLM, Qwen, DeepSeek im Vergleich

Fünf Monate nach einer ersten unkontrollierten Messung hat AutoBe.dev einen ordentlichen Benchmark lokaler und Frontier-LLMs für die Backend-Code-Generierung mittels Function Calling veröffentlicht. Der Benchmark verwendet ein kontrolliertes Variablen-Setup mit einer echten Bewertungsmatrix und testet Modelle an der Generierung rekursiver Union-AST-Schemata über eine Function-Calling-Umgebung.
Wichtigste Ergebnisse
- Die Function-Calling-Umgebung hat die Lücke zwischen Frontier- und lokalen Modellen bei der Backend-Generierung effektiv geschlossen. Insbesondere erreicht
gpt-5.4bei DB/API-Design etwa die gleichen Werte wieqwen3.5-35b-a3b, undclaude-sonnet-4.6erzielt bei Logik die gleichen Ergebnisse wieqwen3.5-27b. - Dies ist die letzte Runde mit Frontier-Modellen. Der monatliche Betrieb kostet rund 200–300 Millionen Tokens (~1.000–1.500 $ pro Modell bei GPT-5.5-Preisen). Ab nächstem Monat werden nur noch OpenRouter-Endpunkte unter 0,25 $/M Tokens oder Modelle, die auf ein Laptop mit 64 GB Unified Memory passen, berücksichtigt.
- Frontend-Automatisierung wird im Juni/Juli zum Benchmark hinzugefügt, unter Verwendung des SDK, das AutoBe bereits ausgibt, um End-to-End-AI-erstellte Frontends zu betreiben (visuell grob, aber alle Funktionen funktionieren).
Unerwartete Umkehrungen
Mehrere Ergebnisse werden noch untersucht:
openai/gpt-5.4erzielt niedrigere Werte als sein eigenesmini-Geschwistermodell.deepseek-v4-prolandet einen Platz unterqwen3.5-35b-a3bund unterscheidet sich kaum von seinem eigenenFlash-Geschwistermodell.- Innerhalb der Qwen-Familie schlägt das dichte 27B-Modell jede MoE-Variante, einschließlich 397B-A17B.
Mögliche Erklärungen, die untersucht werden, umfassen das CoT-Compliance-Phänomen (größere/Frontier-Modelle neigen dazu, prozedurale Anweisungen der Umgebung zu überspringen) und Benchmark-Mängel (n=4 Referenzprojekte, enge Wertespanne, Umgebung bewertet eigene Pipeline).
Empfohlene Modelle
Drei sichere Kandidaten für den nächsten Monat:
openai/gpt-5.4-nano— 0,25 $/M Tokensqwen/qwen3.6-27b— 0,195 $/M Tokensdeepseek/deepseek-v4-flash— 0,14 $/M Tokens
Alle liegen unter 0,25 $/M auf OpenRouter oder sind auf einem Laptop mit 64 GB Unified Memory lauffähig und handhaben Function Calling sauber.
Referenzen
- Benchmark-Dashboard: https://autobe.dev/benchmark/
- Generierungsergebnisse: GitHub: autobe-examples
- GitHub-Repository: https://github.com/wrtnlabs/autobe
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

LibreOffice Online-Entwicklung wird nach Community-Abstimmung wieder aufgenommen
Die Document Foundation hat die Arbeit an LibreOffice Online wieder aufgenommen, nachdem eine Community-Abstimmung den Einfrierungsbeschluss von 2022 aufgehoben hat. TDF wird das Repository für Beiträge wieder öffnen, aber keine Server hosten – stattdessen werden selbst hostbare Tools bereitgestellt.

Britische KI-Investitionsversprechen unter der Lupe: Phantom-Rechenzentren und nicht verifizierte Finanzierung
Eine Untersuchung des Guardian enthüllt, dass die milliardenschwere KI-Initiative des Vereinigten Königreichs 'Phantom-Investitionen' mit gemieteten Rechenzentren, einen Supercomputer-Standort, der noch als Gerüstbauhof betrieben wird, und unbestätigte Arbeitsplatzschaffungsversprechen umfasst.

KI-Neuimplementierung der chardet-Bibliothek wirft Copyleft-Lizenzfragen auf
Dan Blanchard nutzte Anthropics Claude, um die chardet-Python-Bibliothek von Grund auf neu zu implementieren und die Lizenz von LGPL auf MIT zu ändern. Der resultierende Code weist weniger als 1,3 % Ähnlichkeit mit früheren Versionen auf, was eine Debatte darüber auslöst, ob KI-gestützte Neuimplementierung Copyleft-Schutzbestimmungen untergräbt.

Anam Cara-3: Fortschritte in interaktiven KI-Avataren
Anam Cara-3 führt fortschrittliche interaktive Avatare mit einer zweistufigen Pipeline für die Audio-zu-Video-Konvertierung ein, die beeindruckende Geschwindigkeit und Reaktionsfähigkeit erreicht.