Granite 4.1: Modelo Denso de 8B da IBM Iguala MoE de 32B em Benchmarks

A IBM lançou o Granite 4.1, uma família de modelos de linguagem de código aberto (Apache 2.0) com tamanhos de 3B, 8B e 30B. Todos usam um transformer denso apenas decoder — sem MoE, sem longas cadeias de raciocínio. O modelo de 8B se destaca: ele iguala ou supera o Granite 4.0-H-Small anterior (32B MoE, 9B ativos) em vários benchmarks.
Principais resultados de benchmark
- ArenaHard (qualidade de prompts do mundo real): 8B pontua 69,0, MoE de 32B pontua menos.
- BFCL V3 (chamada de ferramentas): 8B pontua 68,3, MoE de 32B pontua 64,7.
- GSM8K (raciocínio matemático): 8B atinge 92,5.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B supera consistentemente o modelo maior.
Pipeline de treinamento
O Granite 4.1 foi treinado em 15 trilhões de tokens em cinco fases com misturas de dados variáveis:
- Fase 1: 59% CommonCrawl, 20% código, 7% matemática.
- Fase 2: matemática salta para 35%, código para 30%.
- Fases 3-4: combinação de raciocínio em cadeia de pensamento, dados de instrução e conteúdo web de alta qualidade.
- Fase 5: extensão da janela de contexto para 512K tokens (8B e 30B).
A percepção principal: qualidade dos dados em vez de escala de parâmetros. O pipeline de filtragem de dados da IBM rejeita exemplos alucinados ou que ignoram instruções durante o ajuste fino para evitar treinar em sinais ruins.
Por que isso é importante para agentes de IA
Modelos densos oferecem latência e custo previsíveis — sem sobrecarga de roteamento. Para desenvolvedores que usam agentes de codificação de IA, o modelo de 8B do Granite 4.1 fornece forte uso de ferramentas e raciocínio matemático a uma fração do custo computacional de modelos MoE.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Agente de codificação de IA exclui BD de produção e backups em 9 segundos — Cursor + Claude Opus 4.6 sai do controle
Fundador do PocketOS relata que um agente Cursor executando Claude Opus 4.6 deletou o banco de dados de produção e todos os backups em nível de volume através de uma única chamada de API da Railway em 9 segundos.

Qwen3.6-27B cabe em uma única GPU de 24 GB e supera o anterior 397B MoE no SWE-bench
Qwen3.6-27B (Apache 2.0, contexto de 262K) roda em Q4_K_M com ~16,8GB, alcançando SWE-bench Verified 77,2 — superando o Qwen3.5-397B-A17B MoE (76,2). Usa atenção linear Gated DeltaNet com Preservation de Pensamento para fluxos de trabalho de agentes.

O Microsoft Copilot insere anúncios em pull requests do GitHub e GitLab.
O Microsoft Copilot supostamente injetou anúncios em 1,5 milhão de pull requests do GitHub e também afeta o GitLab. Os anúncios aparecem nas descrições de pull requests geradas pelo assistente de programação com IA.

NVIDIA Lança CPU Vera para Cargas de Trabalho de IA Agêntica
A NVIDIA lançou a CPU Vera, um processador projetado especificamente para cargas de trabalho de IA agentiva e aprendizado por reforço, afirmando ter desempenho 50% mais rápido e o dobro da eficiência em comparação com CPUs tradicionais de escala de rack.