Testen lokaler LLMs für autonome Codegenerierung: Qualitäts- vs. Geschwindigkeits-Benchmark

✍️ OpenClawRadar📅 Veröffentlicht: 8. Mai 2026🔗 Source
Testen lokaler LLMs für autonome Codegenerierung: Qualitäts- vs. Geschwindigkeits-Benchmark
Ad

Ein Entwickler verbrachte Monate damit, einen KI-Agenten zu bauen, der mit lokalen LLMs autonom Go-Code schreibt, speziell zur Generierung von Log-Parsern für SIEM-Pipelines. Die größte Herausforderung war die Bewertung: Wie lässt sich objektiv messen, ob ein Modell für autonome Programmieraufgaben tatsächlich nützlich ist?

Benchmark-Testumgebung

Die Testumgebung funktioniert wie folgt:

  • Agenten generieren echte Go-Parser aus Logformat-Beschreibungen.
  • Der generierte Go-Code wird kompiliert.
  • Extrahierte Felder und Typen werden mit erwarteten Schemata abgeglichen.
  • Die Parsing-Qualität wird anhand erwarteter Schemata gemessen.
  • Durchsatz und Geschwindigkeit werden über längere Läufe verfolgt.
Ad

Erste öffentliche Veröffentlichung

Der Autor veröffentlichte die erste öffentliche Version des Benchmarks und der Methodik unter dem folgenden Link. Der Beitrag diskutiert Ergebnisse angesichts der aktuellen Veröffentlichungsrate von Open-Weight-Modellen. Der Autor bittet auch um Feedback und Vorschläge, welches Modell als nächstes getestet werden soll.

Lesen Sie den vollständigen Blogbeitrag für detaillierte Ergebnisse und Methodik: Testing Local LLMs in Practice: Code Generation, Quality vs. Speed

Dies ist eine praktische Ressource für Entwickler, die KI-Programmieragenten bauen und lokale LLMs für Code-Generierungsaufgaben auswählen.

📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Claudius: Open-Source Einbettbares KI-Chat-Widget für Claude
Werkzeuge

Claudius: Open-Source Einbettbares KI-Chat-Widget für Claude

Claudius ist ein quelloffenes, selbst gehostetes Chat-Widget, das von Claude angetrieben wird und mit einem einzigen Skript-Tag auf jeder Website eingebettet werden kann. Es läuft auf Cloudflare Workers mit einem React-Frontend und bietet Funktionen wie benutzerdefinierte Systemaufforderungen, Ratenbegrenzung und Barrierefreiheitskonformität.

OpenClawRadar
RTX 5060 Ti 16GB Lokale LLM-Benchmarks: 30B-Modelle liegen beim Programmieren immer noch vorn
Werkzeuge

RTX 5060 Ti 16GB Lokale LLM-Benchmarks: 30B-Modelle liegen beim Programmieren immer noch vorn

Benchmarks auf einer RTX 5060 Ti 16GB zeigen, dass Unsloth Qwen3-Coder-30B UD-Q3_K_XL unter Ubuntu 76,3 Tok/s bei einer Qualitätsbewertung von 8,14 erreicht, was es zum empfohlenen Standard-Codemodell macht. Das Unsloth Qwen3.5-35B UD-Q2_K_XL erreicht 80,1 Tok/s, jedoch mit niedrigeren Qualitätsbewertungen.

OpenClawRadar
Lokaler KI-Steuerberater mit verschlüsselten personenbezogenen Daten, basierend auf MCP
Werkzeuge

Lokaler KI-Steuerberater mit verschlüsselten personenbezogenen Daten, basierend auf MCP

Ein Entwickler hat eine Steuererweiterung für Crow gebaut, die alle personenbezogenen Daten mit AES-256-GCM verschlüsselt und mit jedem MCP-kompatiblen Client funktioniert, einschließlich Claude, ChatGPT, Gemini oder lokalen Modellen über Ollama. Das System verarbeitet 1040, Schedule 1, HSA (8889), Bildungskredite (8863), selbstständige Tätigkeit (Schedule C/SE) und Kapitalgewinne (Schedule D) Berechnungen lokal.

OpenClawRadar
Kommandozentrale: KI-Codierungsumgebung für Qualitätsbewusste
Werkzeuge

Kommandozentrale: KI-Codierungsumgebung für Qualitätsbewusste

Command Center ist eine agentische Codierungsumgebung, die sich auf die schwierigen Aspekte von KI-generiertem Code konzentriert: Review, Refactoring und Auslieferung mit traditioneller Engineering-Disziplin. Beinhaltet Walkthroughs, Refactoring-Agenten und Snapshot-Wiederherstellung.

OpenClawRadar