Benchmark MiMo-V2.5-Pro: Raciocínio Forte em Dedução Social, Bom Valor em Relação ao K2.6

MiMo-V2.5-Pro, o mais recente modelo de pesos abertos da Xiaomi, foi avaliado em partidas autônomas de Blood on the Clocktower — um complexo jogo de dedução social similar a Mafia/Werewolf. O benchmark, criado pelo usuário do Reddit cjami, confronta modelos em partidas completas, medindo raciocínio, engano e uso de ferramentas.
Principais Resultados
- Taxa de vitória: 88% como time do Bem, 48% como time do Mal — geral alta, mas desequilibrada. O desempenho como Mal é a principal fraqueza frente ao Kimi K2.6.
- Eficiência de tokens: 183.639 tokens de saída por partida, similar ao Gemini 3.1 Pro. Compare com Kimi K2.6 com 580 mil tokens (3x mais longo).
- Custo por partida: $0,99 — menos da metade do Kimi K2.6 ($2,65) e muito abaixo do Claude Opus 4.6 ($3,76).
- Duração da partida: 2 a 3 horas (vs. Kimi K2.6 que leva de 10 a 15 horas devido ao raciocínio prolixo).
- Taxa de erro em chamadas de ferramenta: 0,4% — confiável para fluxos de agentes autônomos.
Desempenho Notável
Raciocínio forte sob incerteza: exemplo de pensamento a partir da perspectiva de outros vs. GPT 5.5 e deduções limpas vencendo uma partida.
Erros Notáveis
- Esperou que um Barão do mal se revelasse, resultando em perda — vs. Claude Opus 4.6.
- Capanga confessando seu papel — transcrição.
Conclusão Prática
Para desenvolvedores que precisam de um modelo de pesos abertos com raciocínio forte em configurações multiagente ou de teoria dos jogos, o MiMo-V2.5-Pro oferece o melhor custo-benefício entre os modelos de ponta — menor custo, inferência mais rápida e confiabilidade razoável, embora com espaço para melhoria em papéis adversarial.
Transcrições completas dos modelos e registros de partidas: MiMo-V2.5-Pro no Clocktower Radio. Metodologia: Como funciona.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

A Gestão de Contexto do OpenClaw é Criticada por ser Consumidora de Tokens e com Falhas Arquitetônicas
Uma postagem no Reddit critica o OpenClaw por seu gerenciamento ineficiente de contexto, que leva ao uso excessivo de tokens. O framework anexa todas as ações ao histórico global, criando prompts inchados que sobrecarregam modelos menores e forçam a dependência de modelos de fronteira caros, como o Claude Opus.

CEOs relatam impacto mínimo da IA na produtividade e no emprego em estudo recente
Um estudo com 6.000 executivos descobriu que 90% relataram nenhum impacto da IA no emprego ou na produtividade ao longo de três anos, com o uso médio de IA em 1,5 horas por semana. Economistas comparam isso ao paradoxo da produtividade de Solow da era da TI dos anos 1980.

Estratégia de IA da Apple e a Commoditização da Inteligência
O artigo argumenta que a abordagem conservadora da Apple em relação à IA pode ser vantajosa à medida que a inteligência se torna uma commodity, com modelos como o Gemma4 alcançando 85,2% no MMLU Pro enquanto rodam em telefones, e o Sora da OpenAI custando US$ 15 milhões diários contra uma receita de US$ 2,1 milhões.

Riscos de Litigação em Estruturas de Financiamento de Centros de Dados de IA
A expansão dos data centers de IA exigirá US$ 5,2 trilhões em investimentos em infraestrutura até 2030, com empresas utilizando estruturas de financiamento complexas como veículos de propósito específico (SPVs) e facilidades lastreadas em GPUs, o que gera nove categorias de risco de litígio.