MiMo-V2.5-Pro Evaluado: Fuerte Razonamiento en Deducción Social, Buena Relación Calidad vs K2.6

MiMo-V2.5-Pro, el último modelo de pesos abiertos de Xiaomi, ha sido evaluado en partidas autónomas de Blood on the Clocktower, un complejo juego de deducción social similar a Mafia/Werewolf. La evaluación, creada por el usuario de Reddit cjami, enfrenta a modelos en partidas completas, midiendo razonamiento, engaño y uso de herramientas.
Resultados clave
- Tasa de victorias: 88% como equipo bueno, 48% como equipo malvado — alta en general pero desequilibrada. El rendimiento como malvado es la principal debilidad frente a Kimi K2.6.
- Eficiencia de tokens: 183.639 tokens de salida por partida, similar a Gemini 3.1 Pro. Compárese con Kimi K2.6 con 580.000 tokens (3 veces más).
- Costo por partida: 0.99 $ — menos de la mitad que Kimi K2.6 (2.65 $) y muy por debajo de Claude Opus 4.6 (3.76 $).
- Duración de la partida: 2-3 horas (frente a las 10-15 horas de Kimi K2.6 debido a razonamiento verboso).
- Tasa de error en llamadas a herramientas: 0.4% — fiable para flujos de trabajo de agentes autónomos.
Rendimiento destacado
Fuerte razonamiento bajo incertidumbre: ejemplo de pensar desde la perspectiva de otros frente a GPT 5.5 y deducciones limpias que ganan una partida.
Errores destacados
- Esperó que un Barón malvado se auto-delatara, lo que llevó a una derrota — frente a Claude Opus 4.6.
- Un esbirro confesó su rol — transcripción.
Conclusión práctica
Para desarrolladores que necesitan un modelo de pesos abiertos con razonamiento sólido en entornos multiagente o de teoría de juegos, MiMo-V2.5-Pro ofrece la mejor relación calidad-precio entre los modelos de primer nivel: menor costo, inferencia más rápida y fiabilidad razonable, aunque con margen de mejora en roles adversariales.
Transcripciones completas y registros de partidas: MiMo-V2.5-Pro en Clocktower Radio. Metodología: Cómo funciona.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Colaborador de OpenClaw critica el enfoque del proyecto en la paridad pixel-perfect por sobre características modernas.
Una publicación de Reddit en r/openclaw detalla cómo una solicitud de extracción (PR) de un colaborador que abordaba el escalado de resolución y la compatibilidad con altas tasas de refresco fue rechazada por desviarse de las limitaciones visuales del motor original, generando un debate sobre la dirección del proyecto.

Los agentes de IA necesitan primitivas de reversión, no solo autonomía
Un desarrollador argumenta que los frameworks de agentes deben adoptar conceptos de bases de datos como ACID, sagas y acciones compensatorias para manejar fallos parciales, en lugar de depender de que los LLMs "lo resuelvan".

Claude Corps: la Beca Nacional de $150 millones de Anthropic para la IA sin fines de lucro
Anthropic lanza Claude Corps, una beca de 12 meses que coloca a 1.000 becarios al inicio de su carrera en organizaciones sin fines de lucro para construir herramientas de IA con Claude. Presupuesto de $150M, salario de $85k, mentoría experta.

Nuevos créditos de suscripción de Claude de Anthropic: SDK de agente y claude -p obtienen un grupo separado con límite a partir del 15 de junio
A partir del 15 de junio, los suscriptores de Claude obtendrán un crédito mensual separado para Agent SDK y el uso de claude -p: $200/mes para Max 20x, $100 para Max 5x, $20 para Pro. El uso se detiene cuando el crédito se agota a menos que se opte por facturación adicional. El uso interactivo de Claude Code y el chat permanecen en el pool de suscripción.