Benchmark von lokalem Qwen 3.6 27B als Co-Agent für Codex-Validierung

Ein Entwickler auf r/LocalLLaMA hat ein lokales Qwen-Modell neben OpenAIs Codex als Validator und Herausforderer betrieben und eine kleine reproduzierbare Evaluierungs-Suite erstellt, um zu quantifizieren, welche GGUF-Quant-Profile für diese Rolle am besten geeignet sind. Der Arbeitsablauf: Codex übernimmt die Hauptarbeit im Repository; das lokale Qwen hinterfragt den Plan, prüft auf Überbau, verpasste harte Vorgaben, UI-/Designprobleme, falsche Annahmen und verpasste lange Kontexte. Der Autor überprüft jede Interaktion, bevor es weitergeht.
Aufbau der Evaluierungs-Suite
Die Suite testet Qwen 3.6 27B GGUF-Profile über llama.cpp, einschließlich Bartowski- und Unsloth-Varianten mit verschiedenen Kontextgrößen und KV-Cache-Formaten (q8, f16). Der Fokus liegt auf realen Fehlern: verpasste Vorgaben, schlechtes Challenge-Verhalten, Überbau, UI-Beurteilung und verpasste lange Kontexte.
Wichtigste Ergebnisse
- Die leistungsstärksten Profile in dieser Suite waren:
bartowski-128k-f16,bartowski-128k-q8undunsloth-128k-q8. Alle drei waren gleichauf in der Genauigkeit. - q8 KV Cache zeigte in dieser spezifischen Suite keine messbaren Genauigkeitsverluste.
- Die Kontextgröße war wichtiger als f16-vs-q8 KV für diesen Arbeitsablauf. 65k-Profile versagten, wenn die Suite mehr als 65k Token erforderte.
unsloth-128k-f16wurde geladen, geriet aber bei langen Kontexten auf einer RTX 5090 unter Speicher-/Durchsatzdruck.
Praktische Beobachtungen
Der Autor berichtet, dass Qwen extrem gut darin ist, stille Umgehungen, Überbau und Codierungsabkürzungen in Codex zu erkennen. Bei UI-bezogenen Aufgaben übernimmt Qwen die Führung im Design, während Codex implementiert. Die Rollen tauschen sich: Qwen hinterfragt den Plan, und der Mensch überprüft vor jedem Schritt.
Ressourcen
- Projektseite: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Repository: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Lies die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Aufbau eines Sprachassistenten mit unter 500 ms Latenz: Architektur und Leistungseinblicke
Ein Entwickler hat einen Sprachagenten von Grund auf neu gebaut und dabei eine End-to-End-Latenz von ~400 ms mit vollständigem STT → LLM → TTS-Streaming erreicht. Wichtige Erkenntnisse umfassen die Behandlung von Sprache als Problem der Sprechwechsel, die Verwendung semantischer Sprechwechselerkennung und die gemeinsame Platzierung aller Komponenten für minimale Latenz.

Google Workspace CLI enthält einen OpenClaw-Einrichtungsleitfaden in der Dokumentation
Googles neue gws-Dokumentation (Google Workspace CLI) erwähnt OpenClaw-Setup namentlich in einem eigenen Abschnitt für KI-Agenten-Fähigkeiten. Dies folgt auf aktuelle Diskussionen über Googles Überprüfung von Kontosperrungen für KI-Agenten.

Claude Code LSP: Aktivierung des Language Server Protocol für schnellere und präzisere Code-Navigation
Claude Code wird standardmäßig ohne LSP ausgeliefert, aber durch dessen Aktivierung verwandelt sich die Code-Navigation von 30-60 Sekunden dauernden grep-Suchen in 50ms-Abfragen mit 100%iger Genauigkeit. Die Einrichtung erfordert ein Flag, das über ein GitHub-Issue entdeckt wurde, nicht über die offizielle Dokumentation.

Claudes Code-Dashboard verfolgt 19M+ KI-generierte Commits auf GitHub
Ein Entwickler hat ein Dashboard erstellt, das über 19 Millionen von Claude Code generierte Commits auf GitHub-öffentlichen Repositories verfolgt. Dabei zeigen sich TypeScript (35,3 %), Python (19,2 %) und JavaScript (10,3 %) als die Top-Sprachen. Das System nutzt Next.js mit Recharts und PostgreSQL sowie eine ETL-Pipeline, die die API-Ratenlimits von GitHub umgeht.