最新AIモデルのベンチマーキング:極端モデルの台頭

✍️ OpenClawRadar📅 公開日: February 13, 2026🔗 Source
最新AIモデルのベンチマーキング:極端モデルの台頭
Ad

最近実施された40の新AIモデルのベンチマークは、価格対性能の状況に大きな変化をもたらしています。Kimi k2.5とClaude Opus 4.6に注目が集まる中、分析では『ゴッドモード』と『フラッシュモード』という二つの極端な方向への分裂が明らかになり、中級モデルは非効率とされています。

主な詳細

  • Kimi k2.5の状況: Kimi k2.5のベンチマーク試行は、過負荷が原因と思われる持続的な『コンテンツなし』エラーのため失敗しました。ただし、Kimi-k2-Thinkingは複雑な推論タスクにおいて約15 TPSで適切な性能を発揮しました。
  • 速度の優位性: 遅延に敏感なアプリケーションでは、Liquid LFM 2.5が約359トークン/秒で最速モデルとして登場し、次いでMinistral 3Bが約293トークン/秒でした。
  • コスト効率: Ministral 3Bは最もコスト効率の高いソリューションとして際立っており、入力100万トークンあたり0.10ドルです。GPT-5.2 Codexよりも約17倍安く、約40%高速であり、高価格オプションに対する強力な価値提案となっています。

推奨としては、競争力のある性能を提供しない0.50ドルから1.00ドルの中級モデルは避けるべきです。ニーズに応じて、OpusやGPT-5などの高価格モデルをインテリジェンスのために選択するか、LiquidやMistralでコスト効率の高い速度を選ぶかです。

📖 全文を読む: r/LocalLLaMA

Ad

👀 See Also

MiniMax M2.7モデル、AIコーディングエージェントとして高い性能を発揮
News

MiniMax M2.7モデル、AIコーディングエージェントとして高い性能を発揮

ある開発者がMiniMax M2.7をメインのAIコーディングエージェントとしてテストしたところ、速度とツール関連タスクにおいてGPT 5.4やGemini 3.1 Proを上回り、SWE-Proで56.22%、Terminal Bench 2で57.0%のベンチマークスコアを達成しました。

OpenClawRadar
Google、Microsoft、xAI、AIモデルを早期に米国政府と共有することに合意
News

Google、Microsoft、xAI、AIモデルを早期に米国政府と共有することに合意

Google、Microsoft、xAI(イーロン・マスクのAI企業)は、米国政府による安全性テストのため、自社のAIモデルへの早期アクセスを自主的に提供することに合意した。これはウォール・ストリート・ジャーナルが報じたイニシアチブの一環である。

OpenClawRadar
🦀
News

研究黄金承诺“100%人类撰写、绝非AI”的医学研究——但其团队完全由AI组成

Research Goldは「100%人間が書き、AIではない」医療研究を宣伝しているが、その博士課程の方法論者はAI生成であり、実在の研究者の身元が無断で使用されている。電話はAIアシスタントが応答し、AIであることを否定する。

OpenClawRadar
アトラシアン、AI投資の資金調達のため従業員の10%を削減
News

アトラシアン、AI投資の資金調達のため従業員の10%を削減

AtlassianはAI投資を自己資金で賄い、財務体質を強化するため、1,600人(従業員の10%)を削減。ソフトウェア開発部門では900のポジションが影響を受けます。CEOのMike Cannon-Brookes氏は、AIが人を置き換えるのではなく、必要なスキルを変えると述べています。

OpenClawRadar