最新AIモデルのベンチマーキング:極端モデルの台頭

最近実施された40の新AIモデルのベンチマークは、価格対性能の状況に大きな変化をもたらしています。Kimi k2.5とClaude Opus 4.6に注目が集まる中、分析では『ゴッドモード』と『フラッシュモード』という二つの極端な方向への分裂が明らかになり、中級モデルは非効率とされています。
主な詳細
- Kimi k2.5の状況: Kimi k2.5のベンチマーク試行は、過負荷が原因と思われる持続的な『コンテンツなし』エラーのため失敗しました。ただし、Kimi-k2-Thinkingは複雑な推論タスクにおいて約15 TPSで適切な性能を発揮しました。
- 速度の優位性: 遅延に敏感なアプリケーションでは、Liquid LFM 2.5が約359トークン/秒で最速モデルとして登場し、次いでMinistral 3Bが約293トークン/秒でした。
- コスト効率: Ministral 3Bは最もコスト効率の高いソリューションとして際立っており、入力100万トークンあたり0.10ドルです。GPT-5.2 Codexよりも約17倍安く、約40%高速であり、高価格オプションに対する強力な価値提案となっています。
推奨としては、競争力のある性能を提供しない0.50ドルから1.00ドルの中級モデルは避けるべきです。ニーズに応じて、OpusやGPT-5などの高価格モデルをインテリジェンスのために選択するか、LiquidやMistralでコスト効率の高い速度を選ぶかです。
📖 全文を読む: r/LocalLLaMA
👀 See Also

AIによるchardetライブラリの再実装がコピーレフトライセンスの問題を提起
Dan BlanchardはAnthropicのClaudeを使用して、chardet Pythonライブラリをスクラッチから再実装し、ライセンスをLGPLからMITに変更しました。結果として得られたコードは以前のバージョンと1.3%未満の類似性しかなく、AI支援による再実装がコピーレフト保護を侵食するかどうかについて議論を呼んでいます。

AIエージェントの信頼性と開発パターンに関する研究成果
Claude Opusとの共同研究セッションで、AIエージェントに関する15本の論文を分析し、定量化された信頼性の問題を明らかにしました:エージェントは10回の実行で2〜4種類の異なるアクションシーケンスを生成し、69%の分岐は最初の決定時点で発生しました。自己改善型エージェントでは、安全性拒否率が99.4%から54.4%に低下しました。
OpenClaw v2026.9.4:プラグイン検出、ガイド付きスキル学習、GPT Image 2.5
OpenClaw v2026.9.4では、インストール済みプラグインと利用可能なプラグイン・スキルが1つの検索に統合され、過去の会話を再利用可能なスキルに変える操作可能なSkill Workshopが追加され、GPT Image 2.5 FlareとSunburstがサポートされました。

マイクロソフト、トレーニングの洞察を伴うPhi-4-reasoning-vision-15Bマルチモーダルモデルをリリース
マイクロソフトリサーチは、Microsoft Foundry、HuggingFace、GitHubを通じて利用可能な150億パラメータのオープンウェイトマルチモーダル推論モデル「Phi-4-reasoning-vision-15B」をリリースしました。このモデルは推論能力と効率性のバランスを取り、数学・科学推論やUI理解に優れています。