Testen lokaler LLMs für autonome Codegenerierung: Qualitäts- vs. Geschwindigkeits-Benchmark

Ein Entwickler verbrachte Monate damit, einen KI-Agenten zu bauen, der mit lokalen LLMs autonom Go-Code schreibt, speziell zur Generierung von Log-Parsern für SIEM-Pipelines. Die größte Herausforderung war die Bewertung: Wie lässt sich objektiv messen, ob ein Modell für autonome Programmieraufgaben tatsächlich nützlich ist?
Benchmark-Testumgebung
Die Testumgebung funktioniert wie folgt:
- Agenten generieren echte Go-Parser aus Logformat-Beschreibungen.
- Der generierte Go-Code wird kompiliert.
- Extrahierte Felder und Typen werden mit erwarteten Schemata abgeglichen.
- Die Parsing-Qualität wird anhand erwarteter Schemata gemessen.
- Durchsatz und Geschwindigkeit werden über längere Läufe verfolgt.
Erste öffentliche Veröffentlichung
Der Autor veröffentlichte die erste öffentliche Version des Benchmarks und der Methodik unter dem folgenden Link. Der Beitrag diskutiert Ergebnisse angesichts der aktuellen Veröffentlichungsrate von Open-Weight-Modellen. Der Autor bittet auch um Feedback und Vorschläge, welches Modell als nächstes getestet werden soll.
Lesen Sie den vollständigen Blogbeitrag für detaillierte Ergebnisse und Methodik: Testing Local LLMs in Practice: Code Generation, Quality vs. Speed
Dies ist eine praktische Ressource für Entwickler, die KI-Programmieragenten bauen und lokale LLMs für Code-Generierungsaufgaben auswählen.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Claudius: Open-Source Einbettbares KI-Chat-Widget für Claude
Claudius ist ein quelloffenes, selbst gehostetes Chat-Widget, das von Claude angetrieben wird und mit einem einzigen Skript-Tag auf jeder Website eingebettet werden kann. Es läuft auf Cloudflare Workers mit einem React-Frontend und bietet Funktionen wie benutzerdefinierte Systemaufforderungen, Ratenbegrenzung und Barrierefreiheitskonformität.

RTX 5060 Ti 16GB Lokale LLM-Benchmarks: 30B-Modelle liegen beim Programmieren immer noch vorn
Benchmarks auf einer RTX 5060 Ti 16GB zeigen, dass Unsloth Qwen3-Coder-30B UD-Q3_K_XL unter Ubuntu 76,3 Tok/s bei einer Qualitätsbewertung von 8,14 erreicht, was es zum empfohlenen Standard-Codemodell macht. Das Unsloth Qwen3.5-35B UD-Q2_K_XL erreicht 80,1 Tok/s, jedoch mit niedrigeren Qualitätsbewertungen.

Lokaler KI-Steuerberater mit verschlüsselten personenbezogenen Daten, basierend auf MCP
Ein Entwickler hat eine Steuererweiterung für Crow gebaut, die alle personenbezogenen Daten mit AES-256-GCM verschlüsselt und mit jedem MCP-kompatiblen Client funktioniert, einschließlich Claude, ChatGPT, Gemini oder lokalen Modellen über Ollama. Das System verarbeitet 1040, Schedule 1, HSA (8889), Bildungskredite (8863), selbstständige Tätigkeit (Schedule C/SE) und Kapitalgewinne (Schedule D) Berechnungen lokal.

Kommandozentrale: KI-Codierungsumgebung für Qualitätsbewusste
Command Center ist eine agentische Codierungsumgebung, die sich auf die schwierigen Aspekte von KI-generiertem Code konzentriert: Review, Refactoring und Auslieferung mit traditioneller Engineering-Disziplin. Beinhaltet Walkthroughs, Refactoring-Agenten und Snapshot-Wiederherstellung.