MiMo-V2.5-Pro ベンチマーク評価:強力な社会的推理能力、K2.6に対する良好な価値

✍️ OpenClawRadar📅 公開日: May 1, 2026🔗 Source
MiMo-V2.5-Pro ベンチマーク評価:強力な社会的推理能力、K2.6に対する良好な価値
Ad

Xiaomiの最新オープンウェイトモデルMiMo-V2.5-Proが、複雑な社会的推理ゲーム『ブラッド・オン・ザ・クロックタワー』(マフィア/人狼に類似)の自律プレイでベンチマークされました。Redditユーザーcjamiが作成したこのベンチマークでは、モデル同士をフルゲームで対戦させ、推論、欺瞞、ツール使用を測定します。

主な結果

  • 勝率: 善良陣営88%、邪悪陣営48% — 全体的には高いが偏りあり。邪悪陣営のパフォーマンスがKimi K2.6に対する主な弱点。
  • トークン効率: 1ゲームあたり183,639出力トークン(Gemini 3.1 Proと同等)。Kimi K2.6は580kトークン(3倍長い)。
  • 1ゲームあたりのコスト: 0.99ドル — Kimi K2.6(2.65ドル)の半分以下、Claude Opus 4.6(3.76ドル)を大幅に下回る。
  • マッチ時間: 2~3時間(Kimi K2.6は冗長な推論のため10~15時間)。
  • ツール呼び出しエラー率: 0.4% — 自律エージェントワークフローに信頼性あり。

注目すべきパフォーマンス

不確実性下での強力な推論: GPT 5.5との比較で他者の視点から考える例とクリーンな推理で勝利したゲーム。

Ad

注目すべきミス

実用的なポイント

マルチエージェントやゲーム理論的な設定で強力な推論を必要とする開発者にとって、MiMo-V2.5-Proはトップティアモデルの中で最高の価値を提供します — 低コスト、高速推論、妥当な信頼性。ただし、敵対的な役割においては改善の余地があります。

完全なモデルトランスクリプトとゲームログ: Clocktower RadioのMiMo-V2.5-Pro。方法論: 仕組み。

📖 ソース全文: r/LocalLLaMA

Ad

👀 See Also

Claudeサービスインシデント:全プラットフォームでエラー率上昇
News

Claudeサービスインシデント:全プラットフォームでエラー率上昇

2026年3月2日、Claudeはclaude.ai、コンソール、Claude Codeプラットフォーム全体でエラーが増加し、ログイン/ログアウトのパスや一部のAPIメソッドに影響が及びました。このインシデントは約4時間後に解決されました。

OpenClawRadar
CivBench:用《文明VI》测试AI战略推理——智能体在文化战争失败后核爆图卢兹
News

CivBench:用《文明VI》测试AI战略推理——智能体在文化战争失败后核爆图卢兹

シヴィライゼーションVIをプレイするAIエージェントが、フランスの文化勝利が不可避となった後、核兵器を製造した。この実験「CivBench」は、GovBench(GPT-5で99.26%)のような多肢選択式ベンチマークでは測れない長期的な戦略的推論をテストする。76のMCPツールがゲーム状態をテキストとして公開する。

OpenClawRadar
RTX 2060 Super 8GBでのGPT-1トレーニング – ローカル事前学習の概念実証
News

RTX 2060 Super 8GBでのGPT-1トレーニング – ローカル事前学習の概念実証

開発者がオリジナルのGPT-1(1.17億パラメータ)をローカルのRTX 2060 Super 8GB VRAMで1時間で学習させ、ゲーミングGPUを持つ誰でも10億規模のモデルを事前学習できることを実証。コードと重みはオープンソース化。

OpenClawRadar
NYTマガジン、小規模ビジネスでのOpenClaw実用事例を取材 — Redditから共有されたギフト記事
News

NYTマガジン、小規模ビジネスでのOpenClaw実用事例を取材 — Redditから共有されたギフト記事

New York Times Magazineの記事で、OpenClawのユーザーがビジネスでのAIエージェント活用について語っています。元々はRedditの投稿から始まりました。無料ギフトリンク付き。

OpenClawRadar