Benchmark MiMo-V2.5-Pro: Raciocínio Forte em Dedução Social, Bom Valor em Relação ao K2.6

✍️ OpenClawRadar📅 Publicado: May 1, 2026🔗 Source
Benchmark MiMo-V2.5-Pro: Raciocínio Forte em Dedução Social, Bom Valor em Relação ao K2.6
Ad

MiMo-V2.5-Pro, o mais recente modelo de pesos abertos da Xiaomi, foi avaliado em partidas autônomas de Blood on the Clocktower — um complexo jogo de dedução social similar a Mafia/Werewolf. O benchmark, criado pelo usuário do Reddit cjami, confronta modelos em partidas completas, medindo raciocínio, engano e uso de ferramentas.

Principais Resultados

  • Taxa de vitória: 88% como time do Bem, 48% como time do Mal — geral alta, mas desequilibrada. O desempenho como Mal é a principal fraqueza frente ao Kimi K2.6.
  • Eficiência de tokens: 183.639 tokens de saída por partida, similar ao Gemini 3.1 Pro. Compare com Kimi K2.6 com 580 mil tokens (3x mais longo).
  • Custo por partida: $0,99 — menos da metade do Kimi K2.6 ($2,65) e muito abaixo do Claude Opus 4.6 ($3,76).
  • Duração da partida: 2 a 3 horas (vs. Kimi K2.6 que leva de 10 a 15 horas devido ao raciocínio prolixo).
  • Taxa de erro em chamadas de ferramenta: 0,4% — confiável para fluxos de agentes autônomos.

Desempenho Notável

Raciocínio forte sob incerteza: exemplo de pensamento a partir da perspectiva de outros vs. GPT 5.5 e deduções limpas vencendo uma partida.

Ad

Erros Notáveis

Conclusão Prática

Para desenvolvedores que precisam de um modelo de pesos abertos com raciocínio forte em configurações multiagente ou de teoria dos jogos, o MiMo-V2.5-Pro oferece o melhor custo-benefício entre os modelos de ponta — menor custo, inferência mais rápida e confiabilidade razoável, embora com espaço para melhoria em papéis adversarial.

Transcrições completas dos modelos e registros de partidas: MiMo-V2.5-Pro no Clocktower Radio. Metodologia: Como funciona.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

A Gestão de Contexto do OpenClaw é Criticada por ser Consumidora de Tokens e com Falhas Arquitetônicas
News

A Gestão de Contexto do OpenClaw é Criticada por ser Consumidora de Tokens e com Falhas Arquitetônicas

Uma postagem no Reddit critica o OpenClaw por seu gerenciamento ineficiente de contexto, que leva ao uso excessivo de tokens. O framework anexa todas as ações ao histórico global, criando prompts inchados que sobrecarregam modelos menores e forçam a dependência de modelos de fronteira caros, como o Claude Opus.

OpenClawRadar
CEOs relatam impacto mínimo da IA na produtividade e no emprego em estudo recente
News

CEOs relatam impacto mínimo da IA na produtividade e no emprego em estudo recente

Um estudo com 6.000 executivos descobriu que 90% relataram nenhum impacto da IA no emprego ou na produtividade ao longo de três anos, com o uso médio de IA em 1,5 horas por semana. Economistas comparam isso ao paradoxo da produtividade de Solow da era da TI dos anos 1980.

OpenClawRadar
Estratégia de IA da Apple e a Commoditização da Inteligência
News

Estratégia de IA da Apple e a Commoditização da Inteligência

O artigo argumenta que a abordagem conservadora da Apple em relação à IA pode ser vantajosa à medida que a inteligência se torna uma commodity, com modelos como o Gemma4 alcançando 85,2% no MMLU Pro enquanto rodam em telefones, e o Sora da OpenAI custando US$ 15 milhões diários contra uma receita de US$ 2,1 milhões.

OpenClawRadar
Riscos de Litigação em Estruturas de Financiamento de Centros de Dados de IA
News

Riscos de Litigação em Estruturas de Financiamento de Centros de Dados de IA

A expansão dos data centers de IA exigirá US$ 5,2 trilhões em investimentos em infraestrutura até 2030, com empresas utilizando estruturas de financiamento complexas como veículos de propósito específico (SPVs) e facilidades lastreadas em GPUs, o que gera nove categorias de risco de litígio.

OpenClawRadar