Benchmark von lokalem Qwen 3.6 27B als Co-Agent für Codex-Validierung

Ein Entwickler auf r/LocalLLaMA hat ein lokales Qwen-Modell neben OpenAIs Codex als Validator und Herausforderer betrieben und eine kleine reproduzierbare Evaluierungs-Suite erstellt, um zu quantifizieren, welche GGUF-Quant-Profile für diese Rolle am besten geeignet sind. Der Arbeitsablauf: Codex übernimmt die Hauptarbeit im Repository; das lokale Qwen hinterfragt den Plan, prüft auf Überbau, verpasste harte Vorgaben, UI-/Designprobleme, falsche Annahmen und verpasste lange Kontexte. Der Autor überprüft jede Interaktion, bevor es weitergeht.
Aufbau der Evaluierungs-Suite
Die Suite testet Qwen 3.6 27B GGUF-Profile über llama.cpp, einschließlich Bartowski- und Unsloth-Varianten mit verschiedenen Kontextgrößen und KV-Cache-Formaten (q8, f16). Der Fokus liegt auf realen Fehlern: verpasste Vorgaben, schlechtes Challenge-Verhalten, Überbau, UI-Beurteilung und verpasste lange Kontexte.
Wichtigste Ergebnisse
- Die leistungsstärksten Profile in dieser Suite waren:
bartowski-128k-f16,bartowski-128k-q8undunsloth-128k-q8. Alle drei waren gleichauf in der Genauigkeit. - q8 KV Cache zeigte in dieser spezifischen Suite keine messbaren Genauigkeitsverluste.
- Die Kontextgröße war wichtiger als f16-vs-q8 KV für diesen Arbeitsablauf. 65k-Profile versagten, wenn die Suite mehr als 65k Token erforderte.
unsloth-128k-f16wurde geladen, geriet aber bei langen Kontexten auf einer RTX 5090 unter Speicher-/Durchsatzdruck.
Praktische Beobachtungen
Der Autor berichtet, dass Qwen extrem gut darin ist, stille Umgehungen, Überbau und Codierungsabkürzungen in Codex zu erkennen. Bei UI-bezogenen Aufgaben übernimmt Qwen die Führung im Design, während Codex implementiert. Die Rollen tauschen sich: Qwen hinterfragt den Plan, und der Mensch überprüft vor jedem Schritt.
Ressourcen
- Projektseite: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Repository: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Lies die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

re_gent: Git für KI-Codierungsagenten – Versionskontrolle für Agentenaktivitäten
re_gent ist ein Open-Source-Tool, das Versionskontrolle für KI-Agenten-Sitzungen bietet, jeden Tool-Aufruf verfolgt, Eingabeaufforderungen und Datei-Diffs speichert und Befehle wie `rgt log`, `rgt blame` und `rgt rewind` (demnächst verfügbar) ermöglicht.

MCP-Server fügt Claude Code persistenten Speicher mit Abruf-Bewertung hinzu
Ein Entwickler hat einen MCP-Server namens engram-mcp erstellt, der Claude Code persistenten Speicher über Sitzungen und Projekte hinweg ermöglicht, mit automatischer Abrufbewertung basierend auf Erfolgsergebnissen und Erkennung von Wissensverfall.

Tangent: Chrome-Erweiterung zum Verzweigen von Claude-Gespraechen
Kostenlose Open-Source-Erweiterung zum Oeffnen von Seitenthreads in Claude ohne den Platz zu verlieren.

FlowBoard v5: Der Projektarbeitsbereich, in dem Ihre KI-Agenten tatsächlich laufen
FlowBoard v5 ist ein React-basiertes Projekt-Workspace für KI-Agenten mit einem ereignisgesteuerten Task-Speicher (SQLite), Multi-Agenten-Unterstützung, Ideen-zu-Spezifikationen-Schleife und modularen Übersichts-Widgets.