Benchmark von lokalem Qwen 3.6 27B als Co-Agent für Codex-Validierung

✍️ OpenClawRadar📅 Veröffentlicht: 4. Mai 2026🔗 Source
Benchmark von lokalem Qwen 3.6 27B als Co-Agent für Codex-Validierung
Ad

Ein Entwickler auf r/LocalLLaMA hat ein lokales Qwen-Modell neben OpenAIs Codex als Validator und Herausforderer betrieben und eine kleine reproduzierbare Evaluierungs-Suite erstellt, um zu quantifizieren, welche GGUF-Quant-Profile für diese Rolle am besten geeignet sind. Der Arbeitsablauf: Codex übernimmt die Hauptarbeit im Repository; das lokale Qwen hinterfragt den Plan, prüft auf Überbau, verpasste harte Vorgaben, UI-/Designprobleme, falsche Annahmen und verpasste lange Kontexte. Der Autor überprüft jede Interaktion, bevor es weitergeht.

Aufbau der Evaluierungs-Suite

Die Suite testet Qwen 3.6 27B GGUF-Profile über llama.cpp, einschließlich Bartowski- und Unsloth-Varianten mit verschiedenen Kontextgrößen und KV-Cache-Formaten (q8, f16). Der Fokus liegt auf realen Fehlern: verpasste Vorgaben, schlechtes Challenge-Verhalten, Überbau, UI-Beurteilung und verpasste lange Kontexte.

Wichtigste Ergebnisse

  • Die leistungsstärksten Profile in dieser Suite waren: bartowski-128k-f16, bartowski-128k-q8 und unsloth-128k-q8. Alle drei waren gleichauf in der Genauigkeit.
  • q8 KV Cache zeigte in dieser spezifischen Suite keine messbaren Genauigkeitsverluste.
  • Die Kontextgröße war wichtiger als f16-vs-q8 KV für diesen Arbeitsablauf. 65k-Profile versagten, wenn die Suite mehr als 65k Token erforderte.
  • unsloth-128k-f16 wurde geladen, geriet aber bei langen Kontexten auf einer RTX 5090 unter Speicher-/Durchsatzdruck.
Ad

Praktische Beobachtungen

Der Autor berichtet, dass Qwen extrem gut darin ist, stille Umgehungen, Überbau und Codierungsabkürzungen in Codex zu erkennen. Bei UI-bezogenen Aufgaben übernimmt Qwen die Führung im Design, während Codex implementiert. Die Rollen tauschen sich: Qwen hinterfragt den Plan, und der Mensch überprüft vor jedem Schritt.

Ressourcen

📖 Lies die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Aufbau eines Sprachassistenten mit unter 500 ms Latenz: Architektur und Leistungseinblicke
Werkzeuge

Aufbau eines Sprachassistenten mit unter 500 ms Latenz: Architektur und Leistungseinblicke

Ein Entwickler hat einen Sprachagenten von Grund auf neu gebaut und dabei eine End-to-End-Latenz von ~400 ms mit vollständigem STT → LLM → TTS-Streaming erreicht. Wichtige Erkenntnisse umfassen die Behandlung von Sprache als Problem der Sprechwechsel, die Verwendung semantischer Sprechwechselerkennung und die gemeinsame Platzierung aller Komponenten für minimale Latenz.

OpenClawRadar
Google Workspace CLI enthält einen OpenClaw-Einrichtungsleitfaden in der Dokumentation
Werkzeuge

Google Workspace CLI enthält einen OpenClaw-Einrichtungsleitfaden in der Dokumentation

Googles neue gws-Dokumentation (Google Workspace CLI) erwähnt OpenClaw-Setup namentlich in einem eigenen Abschnitt für KI-Agenten-Fähigkeiten. Dies folgt auf aktuelle Diskussionen über Googles Überprüfung von Kontosperrungen für KI-Agenten.

OpenClawRadar
Claude Code LSP: Aktivierung des Language Server Protocol für schnellere und präzisere Code-Navigation
Werkzeuge

Claude Code LSP: Aktivierung des Language Server Protocol für schnellere und präzisere Code-Navigation

Claude Code wird standardmäßig ohne LSP ausgeliefert, aber durch dessen Aktivierung verwandelt sich die Code-Navigation von 30-60 Sekunden dauernden grep-Suchen in 50ms-Abfragen mit 100%iger Genauigkeit. Die Einrichtung erfordert ein Flag, das über ein GitHub-Issue entdeckt wurde, nicht über die offizielle Dokumentation.

OpenClawRadar
Claudes Code-Dashboard verfolgt 19M+ KI-generierte Commits auf GitHub
Werkzeuge

Claudes Code-Dashboard verfolgt 19M+ KI-generierte Commits auf GitHub

Ein Entwickler hat ein Dashboard erstellt, das über 19 Millionen von Claude Code generierte Commits auf GitHub-öffentlichen Repositories verfolgt. Dabei zeigen sich TypeScript (35,3 %), Python (19,2 %) und JavaScript (10,3 %) als die Top-Sprachen. Das System nutzt Next.js mit Recharts und PostgreSQL sowie eine ETL-Pipeline, die die API-Ratenlimits von GitHub umgeht.

OpenClawRadar