100GB未満のオープンウェイトモデルは、コーディングベンチマークでClaude Haikuに勝てません。

最近のオープンウェイト言語モデルの分析によると、コーディングベンチマークにおいてAnthropicのClaude Haikuと比較して大きな性能差があることが明らかになりました。この比較は特定のテストパラメータとメモリ要件を用いて実施されました。
ベンチマーク手法
評価では、LiveBench(2026年1月)とArena Code/WebDevという2つのコーディングベンチマークでモデルを比較しました。テストは思考機能を有効にしたClaude Haiku 4.5に対して実施されました。モデルはローカルデプロイメントに必要なメモリ要件に応じてプロットされました。
技術仕様
- 量子化:Q4_K_M
- コンテキスト長:32K
- KVキャッシュ:q8_0
- VRAM推定:著者のカスタム計算機を使用して算出
主な発見
100GB未満のメモリを必要とするオープンウェイトモデルでは、いずれのベンチマークでもClaude Haikuの性能に近づくものはありませんでした。最も近い競合モデルはMinimax M2.5で、約136GBのメモリを必要とし、両ベンチマークでHaikuの性能とほぼ同等でした。
この分析は、コーディングタスクにおける100GB未満カテゴリーでのプロプライエタリモデルとオープンウェイトモデルの間の現在のギャップを浮き彫りにしています。著者はこの制限に不満を表明し、少なくともHaikuの能力に匹敵する小型モデルの開発を求めています。
📖 詳細なソースを読む: r/LocalLLaMA
👀 See Also

NVIDIA、Nemotron-3-Ultra-550Bをリリース:550億のアクティブパラメータ、100万トークンのコンテキスト、LatentMoEハイブリッド
NVIDIAがNemotron-3-Ultra-550B-A55B-BF16を公開。550Bパラメータ、55Bアクティブ、100万トークンのコンテキスト、ハイブリッドLatentMoEアーキテクチャ(Mamba-2 + MoE + Attention + MTP)、設定可能な推論機能を搭載。

HNのデータは、arXiv論文のシェアが減少していることを確認しており、LLM(大規模言語モデル)への過熱感はピークを過ぎたのだろうか?
Dylan CastilloはClaudeを使ってHN BigQueryデータをクエリし、LLMが支配的だった2023〜2026年のピーク後、ここ数ヶ月でarXivへのリンクがあるトップページのストーリーの割合が急速に減少していることを発見した。

Google:新規コードの75%がAI生成、エージェントによるコード移行が6倍高速化
Googleは、社内で書かれる新規コードの75%がAI生成であり、人間のエンジニアによるレビューを受けていると発表。2024年の25%から増加し、複雑なコード移行はGeminiエージェントにより6倍高速化した。一部の組織では、業績評価にAI使用目標が組み込まれている。

中国阻止Meta收购AI初创公司Manus
中国政府は、国家安全保障上の懸念を理由に、MetaによるAIスタートアップManusの買収提案を阻止した。この取引は10億ドル以上と評価されていたと報じられている。