Granite 4.1: El modelo denso de 8B de IBM iguala al MoE de 32B en pruebas

IBM lanzó Granite 4.1, una familia de modelos de lenguaje de código abierto (Apache 2.0) con tamaños de 3B, 8B y 30B. Todos usan un transformer denso solo decoder — sin MoE, sin largas cadenas de razonamiento. El modelo de 8B destaca: iguala o supera al anterior Granite 4.0-H-Small (32B MoE, 9B activos) en varios benchmarks.
Resultados clave de benchmarks
- ArenaHard (calidad de prompts del mundo real): 8B obtiene 69.0, 32B MoE obtiene menos.
- BFCL V3 (llamadas a herramientas): 8B obtiene 68.3, 32B MoE obtiene 64.7.
- GSM8K (razonamiento matemático): 8B alcanza 92.5.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B supera consistentemente al modelo más grande.
Pipeline de entrenamiento
Granite 4.1 se entrenó con 15 billones de tokens en cinco fases con mezclas de datos cambiantes:
- Fase 1: 59% CommonCrawl, 20% código, 7% matemáticas.
- Fase 2: matemáticas sube a 35%, código a 30%.
- Fases 3-4: mezcla de razonamiento de cadena de pensamiento, datos de instrucción y contenido web de alta calidad.
- Fase 5: ampliación de la ventana de contexto a 512K tokens (8B y 30B).
La clave: calidad de datos sobre escalado de parámetros. El pipeline de filtrado de datos de IBM rechaza ejemplos alucinados o que ignoran instrucciones durante el ajuste fino para evitar entrenar con señales incorrectas.
Por qué esto importa para los agentes de IA
Los modelos densos ofrecen latencia y coste predecibles — sin sobrecarga de enrutamiento. Para desarrolladores que usan agentes de IA de codificación, el modelo 8B de Granite 4.1 proporciona un buen uso de herramientas y razonamiento matemático a una fracción del coste computacional de los modelos MoE.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Qwen3.6-27B cabe en una única GPU de 24GB, supera al anterior modelo MoE de 397B en SWE-bench
Qwen3.6-27B (Apache 2.0, contexto de 262K) funciona en Q4_K_M en ~16.8GB, logrando un SWE-bench Verified de 77.2 — superando a Qwen3.5-397B-A17B MoE (76.2). Usa atención lineal Gated DeltaNet con Thinking Preservation para flujos de trabajo de agentes.

Aclarando las capacidades de automatización de OpenClaw.
OpenClaw no realiza tareas completamente automatizadas de forma independiente; requiere la guía del usuario para su configuración, actuando más como un LLM tradicional.

Meta capturará los movimientos del mouse y las pulsaciones de teclas de sus empleados para entrenamiento de IA.
Meta planea comenzar a capturar los movimientos del ratón y las pulsaciones de teclas de los empleados para datos de entrenamiento de IA, según un informe de Reuters. El artículo ha generado discusión en Hacker News con 33 puntos y 7 comentarios.

Ohio suspende exención fiscal para centros de datos: crecen presiones de costos de IA para empresas tecnológicas
Ohio suspende una exención del impuesto a las ventas sobre equipos para nuevos centros de datos, incluidos los que alimentan IA. La medida indica un creciente escrutinio estatal a los incentivos fiscales mientras la demanda de infraestructura de IA aumenta.