Realizando pruebas locales de Qwen 3.6 27B como co-agente validador de Codex

Un desarrollador en r/LocalLLaMA ha estado ejecutando un modelo local de Qwen junto con Codex de OpenAI como validador y crítico, y construyó un pequeño conjunto de pruebas reproducible para cuantificar qué perfiles de cuantización GGUF funcionan mejor para este rol. El flujo de trabajo: Codex maneja el trabajo principal del repositorio; el Qwen local critica el plan, verifica sobreconstrucción, directivas ignoradas, problemas de UI/diseño, malas suposiciones y fallos de contexto largo. El autor revisa cada interacción antes de continuar.
Configuración del conjunto de pruebas
El conjunto prueba perfiles GGUF de Qwen 3.6 27B a través de llama.cpp, incluyendo variantes Bartowski y Unsloth en diferentes tamaños de contexto y formatos de caché KV (q8, f16). El enfoque está en fallos del mundo real: directivas ignoradas, mal comportamiento crítico, sobreconstrucción, juicio de UI y fallos de contexto largo.
Hallazgos clave
- Los perfiles con mejor rendimiento en este conjunto fueron:
bartowski-128k-f16,bartowski-128k-q8yunsloth-128k-q8. Los tres empataron en precisión. - La caché KV q8 no mostró pérdida de precisión medible en este conjunto específico.
- El tamaño de contexto importó más que f16 vs q8 KV para este flujo de trabajo. Los perfiles de 65k fallaron cuando el conjunto requería más de 65k tokens.
unsloth-128k-f16se cargó pero encontró presión de memoria/rendimiento en casos de contexto largo en una RTX 5090.
Observaciones prácticas
El autor reporta que Qwen es extremadamente bueno detectando omisiones silenciosas, sobreconstrucción y atajos de codificación en Codex. Para tareas relacionadas con UI, Qwen toma la delantera en diseño mientras Codex implementa. Los roles se invierten: Qwen critica el plan, y el humano revisa antes de cada etapa.
Recursos
- Página del proyecto: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Repositorio: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Supra-50M-Razonamiento: Modelo Tiny de Código Abierto con Pensamiento en Cadena
SupraLabs lanza Supra-50M-Reasoning, un modelo de 50M de parámetros ajustado para producir una cadena de pensamiento completa antes de las respuestas. Dataset de 500 muestras escrito a mano, completamente open source.

Cortex v1.2 añade enriquecimiento con LLM, preguntas y respuestas con citas, y resolución de conflictos.
Cortex, una capa de memoria local para agentes OpenClaw, ha lanzado la versión 1.2 con enriquecimiento aumentado por LLM por defecto, un comando de preguntas y respuestas con citas, y mejoras en deduplicación y resolución de conflictos. La herramienta ahora incluye gestión unificada de configuración y prefiltrado de búsqueda basado en intenciones.

SmallClaw V1.0.3 Agrega Soporte para Webhooks, Automatización n8n y Servidor MCP
SmallClaw V1.0.3 introduce endpoints de webhook para activadores de servicios externos, flujos de trabajo de automatización local con n8n y conexiones de servidor MCP para integración de herramientas. La actualización mantiene el enfoque de la herramienta en ejecutarse con LLMs locales pequeños.

Desarrollador comparte herramientas CLI que funcionan bien con Claude Code.
Un desarrollador cambió de MCPs a CLIs para trabajar con Claude Code, encontrando que Claude maneja comandos CLI de manera efectiva debido a su entrenamiento en scripts de shell y documentación. Compartió los CLIs específicos que usa diariamente, incluyendo gh, ripgrep, stripe, supabase, vercel, sentry-cli y neon.