MiMo-V2.5-Pro ベンチマーク評価:強力な社会的推理能力、K2.6に対する良好な価値

✍️ OpenClawRadar📅 公開日: May 1, 2026🔗 Source
MiMo-V2.5-Pro ベンチマーク評価:強力な社会的推理能力、K2.6に対する良好な価値
Ad

Xiaomiの最新オープンウェイトモデルMiMo-V2.5-Proが、複雑な社会的推理ゲーム『ブラッド・オン・ザ・クロックタワー』(マフィア/人狼に類似)の自律プレイでベンチマークされました。Redditユーザーcjamiが作成したこのベンチマークでは、モデル同士をフルゲームで対戦させ、推論、欺瞞、ツール使用を測定します。

主な結果

  • 勝率: 善良陣営88%、邪悪陣営48% — 全体的には高いが偏りあり。邪悪陣営のパフォーマンスがKimi K2.6に対する主な弱点。
  • トークン効率: 1ゲームあたり183,639出力トークン(Gemini 3.1 Proと同等)。Kimi K2.6は580kトークン(3倍長い)。
  • 1ゲームあたりのコスト: 0.99ドル — Kimi K2.6(2.65ドル)の半分以下、Claude Opus 4.6(3.76ドル)を大幅に下回る。
  • マッチ時間: 2~3時間(Kimi K2.6は冗長な推論のため10~15時間)。
  • ツール呼び出しエラー率: 0.4% — 自律エージェントワークフローに信頼性あり。

注目すべきパフォーマンス

不確実性下での強力な推論: GPT 5.5との比較で他者の視点から考える例クリーンな推理で勝利したゲーム

Ad

注目すべきミス

実用的なポイント

マルチエージェントやゲーム理論的な設定で強力な推論を必要とする開発者にとって、MiMo-V2.5-Proはトップティアモデルの中で最高の価値を提供します — 低コスト、高速推論、妥当な信頼性。ただし、敵対的な役割においては改善の余地があります。

完全なモデルトランスクリプトとゲームログ: Clocktower RadioのMiMo-V2.5-Pro。方法論: 仕組み

📖 ソース全文: r/LocalLLaMA

Ad

👀 See Also

オンラインのコメント投稿者が私のアートを「AI」と判定する時:デヴィッド・ルヴォワのフラストレーション
News

オンラインのコメント投稿者が私のアートを「AI」と判定する時:デヴィッド・ルヴォワのフラストレーション

アーティストのDavid Revoy氏は、タイムラプスを共有しているにもかかわらず、自身の手描きアートがAI生成だと誤って非難するオンライン上のコメントのスクリーンショットを公開しています。彼はこの問題を自身の漫画「Authenticity Problem」で探求しています。

OpenClawRadar
Agora-1: リアルタイム共有シミュレーションのためのオープンソースマルチエージェントワールドモデル
News

Agora-1: リアルタイム共有シミュレーションのためのオープンソースマルチエージェントワールドモデル

OdysseyがAgora-1をリリース。最大4体のエージェント(人間またはAI)がリアルタイムで生成されるシミュレーションを共有できる世界モデルで、テスト環境としてGoldenEyeを使用。

OpenClawRadar
RustプロジェクトにおけるAIの展望:貢献者からの実践的洞察
News

RustプロジェクトにおけるAIの展望:貢献者からの実践的洞察

要約文書は、RustコントリビューターたちのAIツール利用に関する見解を集めたもので、効果的なAI統合には注意深いエンジニアリングが必要であることを強調し、コードベースナビゲーション、コードレビュー支援、半構造化データ処理などの具体的なユースケースを示しています。

OpenClawRadar
Claude Opus 4.5とSonnet 4.5は/モデル選択から削除され、起動フラグが必要です
News

Claude Opus 4.5とSonnet 4.5は/モデル選択から削除され、起動フラグが必要です

Claude Opus 4.5とSonnet 4.5は、セッション中の/model選択メニューから利用できなくなりました。ユーザーは現在、これらの古いバージョンにアクセスするために、完全なモデルIDを指定した--modelフラグを使用してセッションを開始する必要があります。

OpenClawRadar