MiMo-V2.5-Pro Evaluado: Fuerte Razonamiento en Deducción Social, Buena Relación Calidad vs K2.6

✍️ OpenClawRadar📅 Publicado: 1 de mayo de 2026🔗 Source
MiMo-V2.5-Pro Evaluado: Fuerte Razonamiento en Deducción Social, Buena Relación Calidad vs K2.6
Ad

MiMo-V2.5-Pro, el último modelo de pesos abiertos de Xiaomi, ha sido evaluado en partidas autónomas de Blood on the Clocktower, un complejo juego de deducción social similar a Mafia/Werewolf. La evaluación, creada por el usuario de Reddit cjami, enfrenta a modelos en partidas completas, midiendo razonamiento, engaño y uso de herramientas.

Resultados clave

  • Tasa de victorias: 88% como equipo bueno, 48% como equipo malvado — alta en general pero desequilibrada. El rendimiento como malvado es la principal debilidad frente a Kimi K2.6.
  • Eficiencia de tokens: 183.639 tokens de salida por partida, similar a Gemini 3.1 Pro. Compárese con Kimi K2.6 con 580.000 tokens (3 veces más).
  • Costo por partida: 0.99 $ — menos de la mitad que Kimi K2.6 (2.65 $) y muy por debajo de Claude Opus 4.6 (3.76 $).
  • Duración de la partida: 2-3 horas (frente a las 10-15 horas de Kimi K2.6 debido a razonamiento verboso).
  • Tasa de error en llamadas a herramientas: 0.4% — fiable para flujos de trabajo de agentes autónomos.

Rendimiento destacado

Fuerte razonamiento bajo incertidumbre: ejemplo de pensar desde la perspectiva de otros frente a GPT 5.5 y deducciones limpias que ganan una partida.

Ad

Errores destacados

Conclusión práctica

Para desarrolladores que necesitan un modelo de pesos abiertos con razonamiento sólido en entornos multiagente o de teoría de juegos, MiMo-V2.5-Pro ofrece la mejor relación calidad-precio entre los modelos de primer nivel: menor costo, inferencia más rápida y fiabilidad razonable, aunque con margen de mejora en roles adversariales.

Transcripciones completas y registros de partidas: MiMo-V2.5-Pro en Clocktower Radio. Metodología: Cómo funciona.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Google dona el Protocolo de Pagos con Agentes (AP2) a la Alianza FIDO y publica la versión 0.2 con pagos "Humano No Presente"
Noticias

Google dona el Protocolo de Pagos con Agentes (AP2) a la Alianza FIDO y publica la versión 0.2 con pagos "Humano No Presente"

Google dona el Protocolo de Pagos para Agentes (AP2) a la Alianza FIDO y publica la versión 0.2 con soporte para pagos autónomos 'Human Not Present' y un nuevo estándar de Intención Verificable desarrollado conjuntamente con Mastercard.

OpenClawRadar
Usuario de Claude Pro informa que una ventana de uso de 5 horas se consumió con un solo prompt sin generar salida
Noticias

Usuario de Claude Pro informa que una ventana de uso de 5 horas se consumió con un solo prompt sin generar salida

Un usuario de Claude Pro informa que un solo prompt consumió toda su ventana de uso de 5 horas, devolviendo solo texto de planificación y ningún entregable. El incidente resalta problemas con el consumo de tokens durante el razonamiento interno y la falta de salvaguardas.

OpenClawRadar
Claude Opus 4.7 señala preguntas sobre la vacuna contra el hantavirus como riesgo de seguridad, pausando chats
Noticias

Claude Opus 4.7 señala preguntas sobre la vacuna contra el hantavirus como riesgo de seguridad, pausando chats

Preguntar a Claude Opus 4.7 cómo desarrollar una vacuna contra el hantavirus activa filtros de seguridad que pausan el chat, mientras que Sonnet 4.6 también bloquea el modelado predictivo relacionado.

OpenClawRadar
Meta capturará los movimientos del mouse y las pulsaciones de teclas de sus empleados para entrenamiento de IA.
Noticias

Meta capturará los movimientos del mouse y las pulsaciones de teclas de sus empleados para entrenamiento de IA.

Meta planea comenzar a capturar los movimientos del ratón y las pulsaciones de teclas de los empleados para datos de entrenamiento de IA, según un informe de Reuters. El artículo ha generado discusión en Hacker News con 33 puntos y 7 comentarios.

OpenClawRadar