MiMo-V2.5-Pro 벤치마크 결과: 강력한 사회 추론 능력, K2.6 대비 우수한 가치

샤오미의 최신 오픈 가중치 모델인 MiMo-V2.5-Pro가 복잡한 사회 추리 게임 Blood on the Clocktower(마피아/늑대인간과 유사)의 자율 게임에서 벤치마크 테스트를 거쳤습니다. Reddit 사용자 cjami가 만든 이 벤치마크는 모델들을 완전한 게임에서 겨루게 하여 추론, 속임수, 도구 사용 능력을 측정합니다.
주요 결과
- 승률: 선(Good) 팀 88%, 악(Evil) 팀 48% — 전반적으로 높지만 편향됨. 악(Evil) 성능이 Kimi K2.6 대비 주요 약점입니다.
- 토큰 효율: 게임당 183,639개의 출력 토큰으로 Gemini 3.1 Pro와 유사합니다. Kimi K2.6은 580,000토큰(3배 더 김)입니다.
- 게임당 비용: $0.99 — Kimi K2.6($2.65)의 절반 미만, Claude Opus 4.6($3.76)보다 훨씬 낮습니다.
- 매치 시간: 2-3시간 (Kimi K2.6은 장황한 추론으로 10-15시간 소요).
- 도구 호출 오류율: 0.4% — 자율 에이전트 워크플로에 신뢰할 만함.
주목할 만한 성과
불확실성 속에서 강력한 추론: GPT 5.5 대비 타인의 관점에서 생각하는 예 및 깔끔한 추론으로 게임에서 승리한 사례.
주목할 만한 실수
- 악(Evil) Baron이 자진해서 정체를 밝힐 것으로 예상하여 패배 — Claude Opus 4.6 대비.
- Minion이 자신의 역할을 고백 — 대화 기록.
실용적 시사점
다중 에이전트 또는 게임 이론 설정에서 강력한 추론이 필요한 오픈 가중치 모델을 찾는 개발자에게 MiMo-V2.5-Pro는 최고 등급 모델 중 최고의 가치를 제공합니다 — 낮은 비용, 빠른 추론, 합리적인 신뢰성, 다만 적대적 역할에서는 개선의 여지가 있습니다.
전체 모델 대화 기록 및 게임 로그: Clocktower Radio의 MiMo-V2.5-Pro. 방법론: 작동 방식.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

16GB M4 Mac에서 상시 작동 에이전트로 Qwen 35B-A3B 실행 시: RAM보다 먼저 디스크 I/O 실패
16GB M4 Mac에서 llama.cpp로 Qwen 35B-A3B를 실행하면 배치 추론은 가능하지만, Claude Code 및 Codex CLI와 함께 항상 켜져 있는 에이전틱 루프를 돌리면 SSD 경합이 발생하여 시스템 불안정과 크론 작업 누락을 초래합니다. RAM은 문제가 없음에도 불구하고요.

AI 에이전트 일관성 연구: 주요 결과와 실용적 시사점
Claude, GPT-4o, Llama 모델을 대상으로 한 3,000건의 실험 연구에 따르면, 일관된 에이전트는 80~92%의 정확도를 보인 반면, 일관되지 않은 에이전트는 25~60%로 떨어졌으며, 69%의 차이는 첫 번째 도구 호출 시 발생했습니다.

OpenAI의 훈련 비용이 매년 Anthropic의 비용보다 4-5배 더 높을 것으로 예상됩니다
월스트리트저널이 보도한 기밀 재무 자료에 따르면, OpenAI는 향후 5년 동안 매년 Anthropic보다 훈련에 4~5배 더 많은 비용을 지출할 것으로 예상됩니다. 이 비용 규모는 정말로 놀라운 수준으로 묘사됩니다.

ChatGPT 워크스페이스 에이전트 무료 미리보기 오늘 종료 — OpenClaw 및 Hermes와 비교한 성능
OpenAI의 ChatGPT Workspace Agents 무료 미리보기가 5월 6일에 종료되며, 크레딧 기반 요금제로 전환됩니다. Reddit 게시글은 팀 사용과 개인 사용 측면에서 이를 OpenClaw, Hermes 및 BetterClaw와 같은 관리형 플랫폼과 비교합니다.