Realizando pruebas locales de Qwen 3.6 27B como co-agente validador de Codex

Un desarrollador en r/LocalLLaMA ha estado ejecutando un modelo local de Qwen junto con Codex de OpenAI como validador y crítico, y construyó un pequeño conjunto de pruebas reproducible para cuantificar qué perfiles de cuantización GGUF funcionan mejor para este rol. El flujo de trabajo: Codex maneja el trabajo principal del repositorio; el Qwen local critica el plan, verifica sobreconstrucción, directivas ignoradas, problemas de UI/diseño, malas suposiciones y fallos de contexto largo. El autor revisa cada interacción antes de continuar.
Configuración del conjunto de pruebas
El conjunto prueba perfiles GGUF de Qwen 3.6 27B a través de llama.cpp, incluyendo variantes Bartowski y Unsloth en diferentes tamaños de contexto y formatos de caché KV (q8, f16). El enfoque está en fallos del mundo real: directivas ignoradas, mal comportamiento crítico, sobreconstrucción, juicio de UI y fallos de contexto largo.
Hallazgos clave
- Los perfiles con mejor rendimiento en este conjunto fueron:
bartowski-128k-f16,bartowski-128k-q8yunsloth-128k-q8. Los tres empataron en precisión. - La caché KV q8 no mostró pérdida de precisión medible en este conjunto específico.
- El tamaño de contexto importó más que f16 vs q8 KV para este flujo de trabajo. Los perfiles de 65k fallaron cuando el conjunto requería más de 65k tokens.
unsloth-128k-f16se cargó pero encontró presión de memoria/rendimiento en casos de contexto largo en una RTX 5090.
Observaciones prácticas
El autor reporta que Qwen es extremadamente bueno detectando omisiones silenciosas, sobreconstrucción y atajos de codificación en Codex. Para tareas relacionadas con UI, Qwen toma la delantera en diseño mientras Codex implementa. Los roles se invierten: Qwen critica el plan, y el humano revisa antes de cada etapa.
Recursos
- Página del proyecto: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Repositorio: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

La herramienta GrapeRoot reduce los costos de Claude Code en un 45% con contexto de repositorio pre-escaneado.
Una herramienta gratuita llamada GrapeRoot que escanea previamente repositorios y construye gráficos de dependencias redujo los costos de Claude Code en un 45% en promedio en 10 tareas de ingeniería, mientras mejoraba la calidad de las respuestas en un 13%. La herramienta elimina los bucles de exploración que normalmente consumen tokens.

Tycono: Plataforma de Agentes de IA de Código Abierto con Organigrama y Bucles de Mejora Autónoma
Tycono es un entorno de código abierto donde defines roles de agentes de IA en YAML (CTO, ingeniero, QA, etc.) y trabajan juntos siguiendo un organigrama con bucles de mejora autónoma. El sistema ejecutó 17 rondas durante la noche en una tarea de juego de corredor de píxeles, generando 6,796 líneas de código en 43 commits.

Marmy: Una aplicación móvil autohospedada para gestionar múltiples sesiones de agentes de IA de programación
Marmy es una herramienta de código abierto y autoalojada creada con Claude Code que te permite gestionar múltiples sesiones de agentes de programación con IA desde tu teléfono. Incluye un agente Rust para tus máquinas, una aplicación iOS, navegación de archivos con resaltado de sintaxis, notificaciones push y una arquitectura de agente-gestor.

Búsqueda semántica local para conversaciones de IA con fastembed y LanceDB
Un desarrollador indexó localmente 368K mensajes de conversaciones de IA utilizando fastembed para incrustaciones basadas en CPU y LanceDB como almacén vectorial sin servidor, logrando una latencia de búsqueda p50 de 12ms sin claves API.