VibeThinker-3B: Um Modelo de 3B Parâmetros que Iguala o DeepSeek de 671B nos Benchmarks de Matemática AIME

Uma equipe de nove pesquisadores do Sina Weibo publicou um relatório arXiv de 14 páginas neste fim de semana afirmando que um modelo de 3B parâmetros—VibeThinker-3B—iguala ou supera o desempenho de raciocínio de modelos centenas de vezes maiores. O modelo obteve 94,3 no AIME 2026 (American Invitational Mathematics Examination), colocando-o ao lado do DeepSeek V3.2 (671B parâmetros) e à frente do Gemini 3 Pro (91,7). Com uma técnica de escalonamento em tempo de teste chamada Avaliação de Confiabilidade em Nível de Afirmação, a pontuação atinge 97,1.
Principais referências
- AIME 2025: 91,4
- AIME 2026: 94,3 (97,1 com CLRA)
- HMMT 2025: 89,3
- BruMO 2025: 93,8
- IMO-AnswerBench: 76,4
- LiveCodeBench v6 (Pass@1): 80,2
- Competições LeetCode inéditas (abril–maio 2026): 96,1% de taxa de aceitação
- IFEval: 93,4
Notavelmente, o VibeThinker-3B tem desempenho inferior em referências de conhecimento: 70,2 no GPQA-Diamond vs. 91,9 (Gemini 3 Pro) e 87,0 (Claude Opus 4.5). Os autores reconhecem explicitamente que isso é consistente com sua afirmação—raciocínio verificável é "denso em parâmetros," enquanto conhecimento de domínio aberto é "expansivo em parâmetros."
O pipeline de treinamento
O VibeThinker-3B é pós-treinado no Qwen2.5-Coder-3B (time Qwen da Alibaba) usando o "Princípio do Espectro ao Sinal," um pipeline multiestágio introduzido no trabalho anterior da equipe, VibeThinker. O artigo descreve uma Hipótese de Compressão-Cobertura Paramétrica: raciocínio verificável pode ser comprimido em um núcleo compacto, enquanto conhecimento amplo requer mais parâmetros.
Poucas horas após a publicação, o artigo recebeu 62 votos positivos no Hugging Face Daily Papers, o repositório do modelo teve 130 curtidas, e o repositório GitHub teve 685 estrelas. O ceticismo nas redes sociais foi alto—a postagem do usuário @orcus108 acumulou mais de 161 mil visualizações perguntando: "Sinceramente, não sei se isso é um avanço ou se os benchmarks estão quebrados."
Para contexto: o DeepSeek V3.2 tem 671B parâmetros (~224x maior), o GLM-5 tem 744B, e o Kimi K2.5 ultrapassa 1 trilhão. O VibeThinker-3B pode rodar em um laptop comum.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Título padrão do trailer do Copilot com coautoria será ativado no VS Code
O PR #310226 do VS Code da Microsoft altera a configuração padrão git.addAICoAuthor de 'off' para 'all', adicionando automaticamente um trailer Co-authored-by para contribuições geradas por IA. O PR também revela uma incompatibilidade de fallback em tempo de execução no arquivo repository.ts.

Relatórios de Usuários do Anthropic Claude Indicam Restrição Silenciosa de Recursos em Contas Pagas
Um assinante pagante do Claude relata que a execução de shell/bash parou de funcionar em todas as sessões sem notificação, com restrições incorporadas no prompt do sistema no nível de implantação. O usuário abriu vários tickets de suporte e formulários de recurso, mas não recebeu resposta enquanto continuava sendo cobrado.
Claude Code v2.1.282: correções de blocos de pensamento, configurações gerenciadas e uma opção maxProseWidth
Claude Code v2.1.282 adiciona a configuração maxProseWidth, avisos de telemetria e allowClaudeInChromeWithManagedMcp — além de uma longa lista de correções para extended thinking descartado, retomada de sessão e análise de configurações gerenciadas.

Autoresearch Impulsiona Qwen3.5-397B para 20,34 tok/s no M5 Max via Transmissão SSD
Um desenvolvedor alcançou velocidade de inferência de 20,34 tokens/segundo para o modelo Qwen3.5-397B de 209GB em um MacBook Pro M5 Max com 128GB de RAM usando streaming de SSD e 36 experimentos sistemáticos. O resultado representa uma aceleração de 2x em relação à linha de base do M5 Max e 4,67x em relação ao resultado original do M3 Max.