Qwen 3.6 27B F16 pasa la prueba de codificación de Pacman, pero las cuantizaciones de 8 bits fallan — Lecciones clave sobre plantillas y decodificación especulativa MTP

✍️ OpenClawRadar📅 Publicado: 19 de mayo de 2026🔗 Source
Qwen 3.6 27B F16 pasa la prueba de codificación de Pacman, pero las cuantizaciones de 8 bits fallan — Lecciones clave sobre plantillas y decodificación especulativa MTP
Ad

Un desarrollador en r/LocalLLaMA compartió un benchmark práctico de codificación: crear de una sola vez un clon del Pacman en una sola página a partir de un buen prompt, tres intentos, quedarse con el mejor. Qwen 3.6 27B F16 produjo dos juegos casi perfectos, el primer modelo local en lograrlo. Sin embargo, al reducir a cuantificación de 8 bits, los buenos resultados no fueron reproducibles ni siquiera después de cinco intentos, lo que refuerza la afirmación de que la cuantificación de 8 bits no es sin pérdidas para tareas generativas complejas.

Hallazgos técnicos clave del mensaje:

  • La plantilla de chat es crítica: La plantilla oficial de chat de Qwen está ajustada para vLLM y contiene errores en llama.cpp y otros ejecutores. El autor corrigió errores de forma iterativa y, tras el ajuste fino, el modelo sintió "un nuevo nivel de inteligencia".
  • La decodificación especulativa MTP varía según la tarea: Para tareas deterministas como la codificación, los tok/s generativos oscilaron entre 8 y 18 tok/s (línea base sin MTP: 6.6 tok/s). Las tareas creativas experimentan menos aceleración.
  • La elección del harness afecta más la velocidad que la calidad del código: Qwen CLI funcionó sorprendentemente bien, comparable a Claude Code en calidad de salida, pero mucho más rápido porque los prompts adicionales de Claude Code ralentizan los modelos locales. Con un modelo lento como Qwen 3.6 27B a ~6 tok/s, cada prompt adicional añade una latencia dolorosa.
  • No interfieras con la gestión del contexto: El almacenamiento en caché y la compactación del contexto nativos del modelo funcionan bien. Los plugins o herramientas que manipulan la caché o el contexto confunden al modelo y degradan el rendimiento.
  • Las llamadas a herramientas y los subagentes funcionan a la perfección después de corregir la plantilla de chat adecuadamente. La compactación del contexto, el uso del shell y los subagentes paralelos funcionan como se espera.

El autor advierte que los resultados dependen en gran medida de la configuración del ejecutor: usa pesos F16, una plantilla de chat corregida y evita harness pesados a menos que tengas inferencia rápida. El resultado completo del Pacman jugable está disponible en guigand.com/pacman.

Ad

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

La Habilidad OpenClaw 'Consejos de Espera' Muestra Consejos de Aprendizaje Durante los Tiempos de Espera de la Respuesta de IA
Herramientas

La Habilidad OpenClaw 'Consejos de Espera' Muestra Consejos de Aprendizaje Durante los Tiempos de Espera de la Respuesta de IA

La habilidad 'Consejos de Espera' para OpenClaw envía un consejo de aprendizaje aleatorio inmediatamente cuando un usuario envía un mensaje, llenando el tiempo de espera de 5-10 segundos para las respuestas de IA con contenido útil. Incluye 75 consejos bilingües en cinco categorías y funciona en múltiples plataformas de mensajería.

OpenClawRadar
civStation: Un sistema VLM para jugar Civilization VI mediante comandos de lenguaje natural
Herramientas

civStation: Un sistema VLM para jugar Civilization VI mediante comandos de lenguaje natural

civStation es un sistema VLM de uso informático que juega Civilization VI traduciendo comandos de lenguaje natural de alto nivel en acciones dentro del juego. El sistema utiliza una arquitectura de 3 capas que separa la estrategia y la ejecución, con soporte para intervención humana en el bucle.

OpenClawRadar
El Servidor RiserFlow MCP Agrega Capacidades de Comercio Electrónico a OpenClaw
Herramientas

El Servidor RiserFlow MCP Agrega Capacidades de Comercio Electrónico a OpenClaw

Un servidor MCP de código abierto llamado RiserFlow permite a OpenClaw buscar productos semánticamente, gestionar carritos y realizar pedidos reales que aparecen en los sistemas de administración de tiendas, con soporte actual para Bitrix y un patrón de adaptador para otras plataformas.

OpenClawRadar
TruthGuard: Ganchos de Script de Shell que Detectan Mentiras de Agentes de Programación con IA
Herramientas

TruthGuard: Ganchos de Script de Shell que Detectan Mentiras de Agentes de Programación con IA

TruthGuard es una herramienta de código abierto que utiliza ganchos de script de shell para verificar lo que realmente hacen Claude Code y Gemini CLI frente a lo que afirman. Detecta ediciones fantasmas, mentiras sobre códigos de salida, atajos peligrosos y bloquea confirmaciones cuando fallan las pruebas.

OpenClawRadar