オープンソースAIの現状:パリティ達成も、プロダクションギャップは依然として残る

Mozillaの「State of Open Source AI」レポート(V1.0、2026年7月)は、オープンウェイトモデルがトップクローズドモデルとの能力差を縮めたものの、プロダクション導入におけるギャップが残ることを示すデータを提供している。
主要な発見
- 能力ギャップ: Chatbot Arenaのスコア差は2024年8月には8.04%から0.5%に縮小し、2025年2月にはDeepSeek-R1が一時的に同等に達したが、2026年3月にはクローズド推論モデルの進歩により再び3.3%に拡大。オープンモデルはコーディング、指示追従、一般知識で同等か近い水準にあり、ギャップは推論、長文検索、エージェントタスクに集中している。
- 推論コストの急落: GPT-4クラスの推論コストは36ヶ月で50分の1(100万トークンあたり20ドルから0.40ドル)に低下。これはドットコム時代の帯域幅やPCコンピューティングの価格曲線よりも速い。
- トークン量: オープンウェイトモデルは現在、OpenRouter上のプロダクショントークンの過半数を占めている。最もボリュームの多い5モデルはすべてオープンウェイト。中国製モデルは週約18兆トークン、米国製は約5.5兆トークン(FT分析)。
- 採用とプロダクション: AI機能を追加する開発者の79%がオープンモデルを使用している(クローズドは71%)が、プロダクションに到達したのはオープンモデルチームの51%のみ(クローズドは63%)。このギャップは運用ツールと信頼の問題であり、モデルの能力ではない。
レポートは具体的なユースケースを挙げている:マオリ語放送局がデータ主権ライセンスのもとで音声モデルを訓練、PwCが自社ハードウェア上で金融言語に特化したオープンモデルを微調整、研究者が赤十字とともに医療用オープンモデルを構築、農家がデバイス上のオフラインモデルでキャッサバ病を診断、スイスの公共コンソーシアムが公開スーパーコンピュータで国産モデルを訓練し、ウェイトとデータ、訓練コードを公開。
📖 全文を読む(ソース): HN LLM Tools
👀 See Also

Granite 4.1: IBMの8B高密度モデルがベンチマークで32B MoEに匹敵
IBMのGranite 4.1 8B デンスモデルは、ArenaHard、BFCL V3、GSM8Kなどにおいて、改良されたトレーニングデータ品質のおかげで、以前の32B MoEモデルに匹敵するか、それを上回る性能を達成しました。

最新AIモデルのベンチマーキング:極端モデルの台頭
40の新AIモデルを詳細にベンチマークした結果、市場は『ゴッドモード』と『フラッシュモード』が主導する二極化が明らかになりました。中級モデルは現在、時代遅れと見なされています。

OpenClaw v2026.3.11-beta.1がリリースされました。無料のAIモデルとcronの破壊的変更が含まれています。
OpenClaw v2026.3.11-beta.1では、OpenRouterに100万トークンのコンテキストウィンドウを持つ2つの無料AIモデルを導入し、Kimiコーディングツールの呼び出しを修正、OpenCodeプロバイダーのサポートを追加、さらにcronジョブ通知に関する破壊的変更を含んでいます。

Stripeのミニオン:ワンショットエンドツーエンドコーディングエージェントによる開発者生産性の向上
Stripe Minionsは、Stripeエコシステム内の複雑なタスクを自動化することで開発者の生産性を向上させるために設計された、ワンショットのエンドツーエンドコーディングエージェントです。