15のマルチモーダルAIモデルの視覚的推論ベンチマーク結果

ベンチマーク概要
AIMultipleは、200の視覚ベースの質問を使用して、主要な15のマルチモーダルAIモデルの視覚的推論ベンチマークを実施しました。このベンチマークは、データ可視化の解釈に焦点を当てた100のチャート理解問題と、パターン認識と空間推論をカバーする100の視覚的論理問題という2つの異なるトラックに分けられました。
方法論
統計的信頼性を確保するため、各質問は5回実行されました。このベンチマークでは特に、データ可視化の解釈能力と、パターン認識と空間推理を必要とする視覚的論理問題の解決能力がテストされました。
結果
総合リーダーボードでは、Gemini-3.1-pro-previewとGemini-3-pro-previewがリードし、続いてGPT-5.2、Kimi-K2.5、GPT-5.2-proが続いています。結果は、ほとんどのシステムに一貫したパターンを示しています:モデルは、データ駆動型のチャート解釈タスクでは良好な性能を発揮する一方、視覚的論理問題では性能が大幅に低下しています。
マルチモーダルAIシステムを扱う開発者にとって、このベンチマークは、異なるタイプの視覚的推論タスクにおける相対的な強みに関する具体的なデータを提供します。チャート解釈と視覚的論理の間の性能ギャップは、現在のモデルが、抽象的な空間推論よりも構造化された視覚データの処理においてより強力な能力を持っていることを示唆しています。
📖 詳細な情報源を読む: r/ClaudeAI
👀 See Also

エージェンシックAIの失敗モードと発達的足場
エージェンシックAIシステムは、アライメントのドリフト、ハンドオフ間でのコンテキストの喪失、境界の侵害、調整の崩壊を通じて、本番環境で失敗します。ソースは、一貫性監視、調整修復、同意と境界認識、関係の継続性、適応的ガバナンスの5つの構成要素からなる「発達的足場かけ」アプローチを提案しています。

AI推論は明らかに収益性が高い:その経済性を分解する
最先端AI推論プロバイダーは粗利率70〜80%を報告している。コスト試算では70Bモデルの提供に100万トークンあたり約1ドルかかる一方、API価格は100万トークンあたり4.50ドル以上である。

Claude Code 2.1.132:マルチエージェントドキュメント、スケジュールゲート、スキル制限の変更
リリースv2.1.132では、マルチエージェントセッション、成果、ウェブフックに関するManaged Agentsのドキュメントが追加され、プロアクティブな/スケジュール提案に対してデフォルト拒否ゲートが導入され、エージェントあたりの文書化されたスキル上限が64から20に引き下げられました。
OpenClawのAndroid通知転送が1日で127.8Mトークンを消費
r/openclawのユーザーが、1日あたり1億2780万トークンの使用量をAndroidの充電状態通知転送によるものと突き止めた。約30秒ごとにOpenClaw Astraエージェントが起動していた。