MiMo-V2.5-Pro 벤치마크 결과: 강력한 사회 추론 능력, K2.6 대비 우수한 가치

샤오미의 최신 오픈 가중치 모델인 MiMo-V2.5-Pro가 복잡한 사회 추리 게임 Blood on the Clocktower(마피아/늑대인간과 유사)의 자율 게임에서 벤치마크 테스트를 거쳤습니다. Reddit 사용자 cjami가 만든 이 벤치마크는 모델들을 완전한 게임에서 겨루게 하여 추론, 속임수, 도구 사용 능력을 측정합니다.
주요 결과
- 승률: 선(Good) 팀 88%, 악(Evil) 팀 48% — 전반적으로 높지만 편향됨. 악(Evil) 성능이 Kimi K2.6 대비 주요 약점입니다.
- 토큰 효율: 게임당 183,639개의 출력 토큰으로 Gemini 3.1 Pro와 유사합니다. Kimi K2.6은 580,000토큰(3배 더 김)입니다.
- 게임당 비용: $0.99 — Kimi K2.6($2.65)의 절반 미만, Claude Opus 4.6($3.76)보다 훨씬 낮습니다.
- 매치 시간: 2-3시간 (Kimi K2.6은 장황한 추론으로 10-15시간 소요).
- 도구 호출 오류율: 0.4% — 자율 에이전트 워크플로에 신뢰할 만함.
주목할 만한 성과
불확실성 속에서 강력한 추론: GPT 5.5 대비 타인의 관점에서 생각하는 예 및 깔끔한 추론으로 게임에서 승리한 사례.
주목할 만한 실수
- 악(Evil) Baron이 자진해서 정체를 밝힐 것으로 예상하여 패배 — Claude Opus 4.6 대비.
- Minion이 자신의 역할을 고백 — 대화 기록.
실용적 시사점
다중 에이전트 또는 게임 이론 설정에서 강력한 추론이 필요한 오픈 가중치 모델을 찾는 개발자에게 MiMo-V2.5-Pro는 최고 등급 모델 중 최고의 가치를 제공합니다 — 낮은 비용, 빠른 추론, 합리적인 신뢰성, 다만 적대적 역할에서는 개선의 여지가 있습니다.
전체 모델 대화 기록 및 게임 로그: Clocktower Radio의 MiMo-V2.5-Pro. 방법론: 작동 방식.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

클로드 코드 v2.1.117 릴리스: 서브에이전트 포킹, 플러그인 개선 및 성능 수정
Claude Code v2.1.117는 CLAUDE_CODE_FORK_SUBAGENT=1 설정을 통해 외부 빌드에서 포크된 서브에이전트를 활성화할 수 있도록 하고, 플러그인 의존성 처리를 개선하며, Opus 4.7 컨텍스트 윈도우 계산을 수정합니다. 이번 릴리스에는 동시 MCP 연결로 더 빠른 시작 시간과 macOS/Linux에서 Glob/Grep 도구를 내장된 bfs/ugrep으로 대체하는 내용이 포함됩니다.
AI 지원 개발은 스테이크 요리와 같다: 시작은 쉽지만, 마스터하기는 어렵다
개발자의 비유: AI는 코드를 빠르게 생성할 수 있지만, 일관되게 좋은 소프트웨어를 만들기 위해서는 여전히 깊은 이해, 판단력, 경험이 필요합니다.

클로드 오푸스 4.7 시스템 프롬프트 변경사항: 플랫폼 명칭 변경, 도구 통합 및 행동 업데이트
Anthropic은 Claude Opus 시스템 프롬프트를 4.6 버전(2026년 2월 5일)에서 4.7 버전(2026년 4월 16일)으로 업데이트했습니다. 주요 변경 사항으로는 '개발자 플랫폼'을 'Claude 플랫폼'으로 명칭 변경, 도구 목록에 Claude in Powerpoint 추가, 아동 안전 지침 확대, 도구 사용 및 응답 간결성에 대한 새로운 행동 지침 도입 등이 있습니다.

Qwen3.5-122B on Blackwell SM120: fp8 KV 캐시 손상 문제 및 성능 분석 결과
8x RTX PRO 6000 Blackwell 하드웨어에서 Qwen3.5-122B를 테스트한 결과, fp8_e4m3 KV 캐시가 오류 없이 조용히 손상된 출력을 생성하는 문제가 발견되어 bf16 KV 캐시를 사용해야 합니다. MTP 최적화는 단일 요청 속도를 2.75배 향상시켰지만, DeltaNet 제약으로 인해 다른 최적화는 차단되었습니다.