Qwen 3.6 27B F16 pasa la prueba de codificación de Pacman, pero las cuantizaciones de 8 bits fallan — Lecciones clave sobre plantillas y decodificación especulativa MTP

✍️ OpenClawRadar📅 Publicado: 19 de mayo de 2026🔗 Source
Qwen 3.6 27B F16 pasa la prueba de codificación de Pacman, pero las cuantizaciones de 8 bits fallan — Lecciones clave sobre plantillas y decodificación especulativa MTP
Ad

Un desarrollador en r/LocalLLaMA compartió un benchmark práctico de codificación: crear de una sola vez un clon del Pacman en una sola página a partir de un buen prompt, tres intentos, quedarse con el mejor. Qwen 3.6 27B F16 produjo dos juegos casi perfectos, el primer modelo local en lograrlo. Sin embargo, al reducir a cuantificación de 8 bits, los buenos resultados no fueron reproducibles ni siquiera después de cinco intentos, lo que refuerza la afirmación de que la cuantificación de 8 bits no es sin pérdidas para tareas generativas complejas.

Hallazgos técnicos clave del mensaje:

  • La plantilla de chat es crítica: La plantilla oficial de chat de Qwen está ajustada para vLLM y contiene errores en llama.cpp y otros ejecutores. El autor corrigió errores de forma iterativa y, tras el ajuste fino, el modelo sintió "un nuevo nivel de inteligencia".
  • La decodificación especulativa MTP varía según la tarea: Para tareas deterministas como la codificación, los tok/s generativos oscilaron entre 8 y 18 tok/s (línea base sin MTP: 6.6 tok/s). Las tareas creativas experimentan menos aceleración.
  • La elección del harness afecta más la velocidad que la calidad del código: Qwen CLI funcionó sorprendentemente bien, comparable a Claude Code en calidad de salida, pero mucho más rápido porque los prompts adicionales de Claude Code ralentizan los modelos locales. Con un modelo lento como Qwen 3.6 27B a ~6 tok/s, cada prompt adicional añade una latencia dolorosa.
  • No interfieras con la gestión del contexto: El almacenamiento en caché y la compactación del contexto nativos del modelo funcionan bien. Los plugins o herramientas que manipulan la caché o el contexto confunden al modelo y degradan el rendimiento.
  • Las llamadas a herramientas y los subagentes funcionan a la perfección después de corregir la plantilla de chat adecuadamente. La compactación del contexto, el uso del shell y los subagentes paralelos funcionan como se espera.

El autor advierte que los resultados dependen en gran medida de la configuración del ejecutor: usa pesos F16, una plantilla de chat corregida y evita harness pesados a menos que tengas inferencia rápida. El resultado completo del Pacman jugable está disponible en guigand.com/pacman.

Ad

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Octopoda: Capa de Memoria de Código Abierto para Agentes de IA Locales
Herramientas

Octopoda: Capa de Memoria de Código Abierto para Agentes de IA Locales

Octopoda es una capa de memoria de código abierto que proporciona a los agentes de IA locales memoria persistente entre sesiones, búsqueda semántica, detección de bucles y recuperación de fallos. Funciona completamente sin conexión con un modelo de incrustación de 33 MB y se integra con LangChain, CrewAI, AutoGen y OpenAI Agents SDK.

OpenClawRadar
Deblank: Herramienta para Eliminar el Formato de Código y Reducir Tokens en LLM
Herramientas

Deblank: Herramienta para Eliminar el Formato de Código y Reducir Tokens en LLM

Deblank es una herramienta de código abierto que elimina el formato del código (sangría, espacios en blanco, saltos de línea) antes de enviarlo a LLMs, reduciendo tokens en aproximadamente un 30% para Java/C++ y un 9% para Python con una latencia de ~76ms. Es compatible con Python, Java, C/C++, C#, JS/TS y Go.

OpenClawRadar
Sobrecarga de contexto en MCP: Costos reales y una solución práctica para usuarios de Claude Code
Herramientas

Sobrecarga de contexto en MCP: Costos reales y una solución práctica para usuarios de Claude Code

Ejecutar 9 servidores MCP en Claude Code genera un inicio en frío de 38k tokens, ~$700/mes en overhead de definiciones de herramientas y degradación del rendimiento del modelo. Un patrón de puerta de enlace con clasificación BM25 reduce el contexto a 4k.

OpenClawRadar
Jake Benchmark v1: Pruebas de Rendimiento de LLM Local para Agentes de IA OpenClaw
Herramientas

Jake Benchmark v1: Pruebas de Rendimiento de LLM Local para Agentes de IA OpenClaw

Un desarrollador probó 7 LLM locales como agentes de IA con OpenClaw utilizando 22 tareas prácticas que incluyen procesamiento de correos electrónicos, programación de reuniones y detección de phishing. Los resultados variaron desde un 59.4% para Qwen 27B hasta un 1.6% para Nemotron 30B, con registros detallados de conversaciones disponibles.

OpenClawRadar