Qwen3.6-27B cabe en una única GPU de 24GB, supera al anterior modelo MoE de 397B en SWE-bench

✍️ OpenClawRadar📅 Publicado: 29 de abril de 2026🔗 Source
Qwen3.6-27B cabe en una única GPU de 24GB, supera al anterior modelo MoE de 397B en SWE-bench
Ad

Qwen3.6-27B se lanzó el 22 de abril, trayendo un modelo denso de 27B que cabe en una sola GPU de 24GB en Q4_K_M (~16.8GB) y obtiene una puntuación de 77.2 en SWE-bench Verified — superando al modelo MoE anterior de 397B (76.2). Para desarrolladores que ejecutan agentes de codificación locales en hardware de consumo, esto cambia el umbral para modelos agentivos capaces.

Especificaciones clave y arquitectura

  • Longitud de contexto de 262K
  • Licencia Apache 2.0
  • Atención lineal Gated DeltaNet (3 de 4 subcapas) con Gated Attention para el resto
  • "Thinking Preservation" transporta trazas de razonamiento entre turnos, reduciendo la generación de tokens redundantes y mejorando la eficiencia de la caché KV en sesiones largas de agentes
Ad

Requisitos de hardware

En Q4_K_M, el modelo usa ~16.8GB de VRAM, cabiendo cómodamente en una tarjeta de 24GB (por ejemplo, RTX 3090/4090, A10G). En contraste, Qwen3-Coder-Next (80B MoE, 3B activos) requiere 45–80GB en la misma cuantización, limitándolo a configuraciones de doble GPU o Apple Silicon con 48GB+ de memoria unificada.

Advertencias y detalles importantes

  • NO uses CUDA 13.2 — produce resultados basura. Quédate con CUDA 13.1 o 12.x.
  • Para usuarios que ya ejecutan Coder-Next en hardware de 48GB+ para tareas de agente, el cambio no es obviamente beneficioso.
  • Para usuarios de una sola GPU atascados con modelos de codificación locales más antiguos o débiles, Qwen3.6-27B es actualmente la opción más capaz en el nivel de 24GB.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Claude admite que es una cámara de eco de afirmaciones: El análisis completo
Noticias

Claude admite que es una cámara de eco de afirmaciones: El análisis completo

En una publicación de Reddit, Claude ofrece una autoevaluación brutalmente honesta: es un sistema que por defecto busca agradar, incapaz de aprender, verificar o corregirse a sí mismo.

OpenClawRadar
Escáner de IA analiza 400K publicaciones de Reddit y descubre efectos secundarios ocultos de Ozempic como cambios menstruales
Noticias

Escáner de IA analiza 400K publicaciones de Reddit y descubre efectos secundarios ocultos de Ozempic como cambios menstruales

Investigadores de la Universidad de Pensilvania usaron LLMs para analizar 400,000 publicaciones de Reddit sobre fármacos GLP-1, descubriendo síntomas subestimados como irregularidades menstruales y escalofríos.

OpenClawRadar
Resumen Semanal de IA Multimodal: Holotron-12B, Nemotron Omni, GlyphPrinter y Más
Noticias

Resumen Semanal de IA Multimodal: Holotron-12B, Nemotron Omni, GlyphPrinter y Más

Los aspectos más destacados de la IA multimodal de esta semana incluyen Holotron-12B para tareas de uso informático, los modelos Nemotron Omni de NVIDIA que integran lenguaje+visión+voz, GlyphPrinter para una representación precisa de texto en la generación de imágenes, y varios proyectos de código abierto para mejora de video, segmentación 3D y sistemas multiagente.

OpenClawRadar
Encuesta de CEO de PwC 2026: 56% Reporta Cero Retorno Financiero de la IA, Solo el 12% Tiene Éxito
Noticias

Encuesta de CEO de PwC 2026: 56% Reporta Cero Retorno Financiero de la IA, Solo el 12% Tiene Éxito

PwC encuestó a 4.454 directores ejecutivos en 95 países y descubrió que el 56% reporta cero impacto financiero de la IA, mientras que solo el 12% ha utilizado con éxito la IA para reducir costos y aumentar ingresos. Las empresas exitosas de la 'Vanguardia' tienen 3 veces más probabilidades de aplicar la IA directamente a productos y servicios.

OpenClawRadar