MiMo-V2.5-Pro Evaluado: Fuerte Razonamiento en Deducción Social, Buena Relación Calidad vs K2.6

MiMo-V2.5-Pro, el último modelo de pesos abiertos de Xiaomi, ha sido evaluado en partidas autónomas de Blood on the Clocktower, un complejo juego de deducción social similar a Mafia/Werewolf. La evaluación, creada por el usuario de Reddit cjami, enfrenta a modelos en partidas completas, midiendo razonamiento, engaño y uso de herramientas.
Resultados clave
- Tasa de victorias: 88% como equipo bueno, 48% como equipo malvado — alta en general pero desequilibrada. El rendimiento como malvado es la principal debilidad frente a Kimi K2.6.
- Eficiencia de tokens: 183.639 tokens de salida por partida, similar a Gemini 3.1 Pro. Compárese con Kimi K2.6 con 580.000 tokens (3 veces más).
- Costo por partida: 0.99 $ — menos de la mitad que Kimi K2.6 (2.65 $) y muy por debajo de Claude Opus 4.6 (3.76 $).
- Duración de la partida: 2-3 horas (frente a las 10-15 horas de Kimi K2.6 debido a razonamiento verboso).
- Tasa de error en llamadas a herramientas: 0.4% — fiable para flujos de trabajo de agentes autónomos.
Rendimiento destacado
Fuerte razonamiento bajo incertidumbre: ejemplo de pensar desde la perspectiva de otros frente a GPT 5.5 y deducciones limpias que ganan una partida.
Errores destacados
- Esperó que un Barón malvado se auto-delatara, lo que llevó a una derrota — frente a Claude Opus 4.6.
- Un esbirro confesó su rol — transcripción.
Conclusión práctica
Para desarrolladores que necesitan un modelo de pesos abiertos con razonamiento sólido en entornos multiagente o de teoría de juegos, MiMo-V2.5-Pro ofrece la mejor relación calidad-precio entre los modelos de primer nivel: menor costo, inferencia más rápida y fiabilidad razonable, aunque con margen de mejora en roles adversariales.
Transcripciones completas y registros de partidas: MiMo-V2.5-Pro en Clocktower Radio. Metodología: Cómo funciona.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Google dona el Protocolo de Pagos con Agentes (AP2) a la Alianza FIDO y publica la versión 0.2 con pagos "Humano No Presente"
Google dona el Protocolo de Pagos para Agentes (AP2) a la Alianza FIDO y publica la versión 0.2 con soporte para pagos autónomos 'Human Not Present' y un nuevo estándar de Intención Verificable desarrollado conjuntamente con Mastercard.

Usuario de Claude Pro informa que una ventana de uso de 5 horas se consumió con un solo prompt sin generar salida
Un usuario de Claude Pro informa que un solo prompt consumió toda su ventana de uso de 5 horas, devolviendo solo texto de planificación y ningún entregable. El incidente resalta problemas con el consumo de tokens durante el razonamiento interno y la falta de salvaguardas.

Claude Opus 4.7 señala preguntas sobre la vacuna contra el hantavirus como riesgo de seguridad, pausando chats
Preguntar a Claude Opus 4.7 cómo desarrollar una vacuna contra el hantavirus activa filtros de seguridad que pausan el chat, mientras que Sonnet 4.6 también bloquea el modelado predictivo relacionado.

Meta capturará los movimientos del mouse y las pulsaciones de teclas de sus empleados para entrenamiento de IA.
Meta planea comenzar a capturar los movimientos del ratón y las pulsaciones de teclas de los empleados para datos de entrenamiento de IA, según un informe de Reuters. El artículo ha generado discusión en Hacker News con 33 puntos y 7 comentarios.