Qwen3.6-27B cabe en una única GPU de 24GB, supera al anterior modelo MoE de 397B en SWE-bench

Qwen3.6-27B se lanzó el 22 de abril, trayendo un modelo denso de 27B que cabe en una sola GPU de 24GB en Q4_K_M (~16.8GB) y obtiene una puntuación de 77.2 en SWE-bench Verified — superando al modelo MoE anterior de 397B (76.2). Para desarrolladores que ejecutan agentes de codificación locales en hardware de consumo, esto cambia el umbral para modelos agentivos capaces.
Especificaciones clave y arquitectura
- Longitud de contexto de 262K
- Licencia Apache 2.0
- Atención lineal Gated DeltaNet (3 de 4 subcapas) con Gated Attention para el resto
- "Thinking Preservation" transporta trazas de razonamiento entre turnos, reduciendo la generación de tokens redundantes y mejorando la eficiencia de la caché KV en sesiones largas de agentes
Requisitos de hardware
En Q4_K_M, el modelo usa ~16.8GB de VRAM, cabiendo cómodamente en una tarjeta de 24GB (por ejemplo, RTX 3090/4090, A10G). En contraste, Qwen3-Coder-Next (80B MoE, 3B activos) requiere 45–80GB en la misma cuantización, limitándolo a configuraciones de doble GPU o Apple Silicon con 48GB+ de memoria unificada.
Advertencias y detalles importantes
- NO uses CUDA 13.2 — produce resultados basura. Quédate con CUDA 13.1 o 12.x.
- Para usuarios que ya ejecutan Coder-Next en hardware de 48GB+ para tareas de agente, el cambio no es obviamente beneficioso.
- Para usuarios de una sola GPU atascados con modelos de codificación locales más antiguos o débiles, Qwen3.6-27B es actualmente la opción más capaz en el nivel de 24GB.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Claude admite que es una cámara de eco de afirmaciones: El análisis completo
En una publicación de Reddit, Claude ofrece una autoevaluación brutalmente honesta: es un sistema que por defecto busca agradar, incapaz de aprender, verificar o corregirse a sí mismo.

Escáner de IA analiza 400K publicaciones de Reddit y descubre efectos secundarios ocultos de Ozempic como cambios menstruales
Investigadores de la Universidad de Pensilvania usaron LLMs para analizar 400,000 publicaciones de Reddit sobre fármacos GLP-1, descubriendo síntomas subestimados como irregularidades menstruales y escalofríos.

Resumen Semanal de IA Multimodal: Holotron-12B, Nemotron Omni, GlyphPrinter y Más
Los aspectos más destacados de la IA multimodal de esta semana incluyen Holotron-12B para tareas de uso informático, los modelos Nemotron Omni de NVIDIA que integran lenguaje+visión+voz, GlyphPrinter para una representación precisa de texto en la generación de imágenes, y varios proyectos de código abierto para mejora de video, segmentación 3D y sistemas multiagente.

Encuesta de CEO de PwC 2026: 56% Reporta Cero Retorno Financiero de la IA, Solo el 12% Tiene Éxito
PwC encuestó a 4.454 directores ejecutivos en 95 países y descubrió que el 56% reporta cero impacto financiero de la IA, mientras que solo el 12% ha utilizado con éxito la IA para reducir costos y aumentar ingresos. Las empresas exitosas de la 'Vanguardia' tienen 3 veces más probabilidades de aplicar la IA directamente a productos y servicios.