Lokaler LLM-Benchmark: Backend-Generierung durch Funktionsaufruf – GLM, Qwen, DeepSeek im Vergleich

✍️ OpenClawRadar📅 Veröffentlicht: 3. Mai 2026🔗 Source
Lokaler LLM-Benchmark: Backend-Generierung durch Funktionsaufruf – GLM, Qwen, DeepSeek im Vergleich
Ad

Fünf Monate nach einer ersten unkontrollierten Messung hat AutoBe.dev einen ordentlichen Benchmark lokaler und Frontier-LLMs für die Backend-Code-Generierung mittels Function Calling veröffentlicht. Der Benchmark verwendet ein kontrolliertes Variablen-Setup mit einer echten Bewertungsmatrix und testet Modelle an der Generierung rekursiver Union-AST-Schemata über eine Function-Calling-Umgebung.

Wichtigste Ergebnisse

  • Die Function-Calling-Umgebung hat die Lücke zwischen Frontier- und lokalen Modellen bei der Backend-Generierung effektiv geschlossen. Insbesondere erreicht gpt-5.4 bei DB/API-Design etwa die gleichen Werte wie qwen3.5-35b-a3b, und claude-sonnet-4.6 erzielt bei Logik die gleichen Ergebnisse wie qwen3.5-27b.
  • Dies ist die letzte Runde mit Frontier-Modellen. Der monatliche Betrieb kostet rund 200–300 Millionen Tokens (~1.000–1.500 $ pro Modell bei GPT-5.5-Preisen). Ab nächstem Monat werden nur noch OpenRouter-Endpunkte unter 0,25 $/M Tokens oder Modelle, die auf ein Laptop mit 64 GB Unified Memory passen, berücksichtigt.
  • Frontend-Automatisierung wird im Juni/Juli zum Benchmark hinzugefügt, unter Verwendung des SDK, das AutoBe bereits ausgibt, um End-to-End-AI-erstellte Frontends zu betreiben (visuell grob, aber alle Funktionen funktionieren).
Ad

Unerwartete Umkehrungen

Mehrere Ergebnisse werden noch untersucht:

  • openai/gpt-5.4 erzielt niedrigere Werte als sein eigenes mini-Geschwistermodell.
  • deepseek-v4-pro landet einen Platz unter qwen3.5-35b-a3b und unterscheidet sich kaum von seinem eigenen Flash-Geschwistermodell.
  • Innerhalb der Qwen-Familie schlägt das dichte 27B-Modell jede MoE-Variante, einschließlich 397B-A17B.

Mögliche Erklärungen, die untersucht werden, umfassen das CoT-Compliance-Phänomen (größere/Frontier-Modelle neigen dazu, prozedurale Anweisungen der Umgebung zu überspringen) und Benchmark-Mängel (n=4 Referenzprojekte, enge Wertespanne, Umgebung bewertet eigene Pipeline).

Empfohlene Modelle

Drei sichere Kandidaten für den nächsten Monat:

  • openai/gpt-5.4-nano — 0,25 $/M Tokens
  • qwen/qwen3.6-27b — 0,195 $/M Tokens
  • deepseek/deepseek-v4-flash — 0,14 $/M Tokens

Alle liegen unter 0,25 $/M auf OpenRouter oder sind auf einem Laptop mit 64 GB Unified Memory lauffähig und handhaben Function Calling sauber.

Referenzen

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

LibreOffice Online-Entwicklung wird nach Community-Abstimmung wieder aufgenommen
Nachrichten

LibreOffice Online-Entwicklung wird nach Community-Abstimmung wieder aufgenommen

Die Document Foundation hat die Arbeit an LibreOffice Online wieder aufgenommen, nachdem eine Community-Abstimmung den Einfrierungsbeschluss von 2022 aufgehoben hat. TDF wird das Repository für Beiträge wieder öffnen, aber keine Server hosten – stattdessen werden selbst hostbare Tools bereitgestellt.

OpenClawRadar
Britische KI-Investitionsversprechen unter der Lupe: Phantom-Rechenzentren und nicht verifizierte Finanzierung
Nachrichten

Britische KI-Investitionsversprechen unter der Lupe: Phantom-Rechenzentren und nicht verifizierte Finanzierung

Eine Untersuchung des Guardian enthüllt, dass die milliardenschwere KI-Initiative des Vereinigten Königreichs 'Phantom-Investitionen' mit gemieteten Rechenzentren, einen Supercomputer-Standort, der noch als Gerüstbauhof betrieben wird, und unbestätigte Arbeitsplatzschaffungsversprechen umfasst.

OpenClawRadar
KI-Neuimplementierung der chardet-Bibliothek wirft Copyleft-Lizenzfragen auf
Nachrichten

KI-Neuimplementierung der chardet-Bibliothek wirft Copyleft-Lizenzfragen auf

Dan Blanchard nutzte Anthropics Claude, um die chardet-Python-Bibliothek von Grund auf neu zu implementieren und die Lizenz von LGPL auf MIT zu ändern. Der resultierende Code weist weniger als 1,3 % Ähnlichkeit mit früheren Versionen auf, was eine Debatte darüber auslöst, ob KI-gestützte Neuimplementierung Copyleft-Schutzbestimmungen untergräbt.

OpenClawRadar
Anam Cara-3: Fortschritte in interaktiven KI-Avataren
Nachrichten

Anam Cara-3: Fortschritte in interaktiven KI-Avataren

Anam Cara-3 führt fortschrittliche interaktive Avatare mit einer zweistufigen Pipeline für die Audio-zu-Video-Konvertierung ein, die beeindruckende Geschwindigkeit und Reaktionsfähigkeit erreicht.

OpenClawRadar