100GB未満のオープンウェイトモデルは、コーディングベンチマークでClaude Haikuに勝てません。

最近のオープンウェイト言語モデルの分析によると、コーディングベンチマークにおいてAnthropicのClaude Haikuと比較して大きな性能差があることが明らかになりました。この比較は特定のテストパラメータとメモリ要件を用いて実施されました。
ベンチマーク手法
評価では、LiveBench(2026年1月)とArena Code/WebDevという2つのコーディングベンチマークでモデルを比較しました。テストは思考機能を有効にしたClaude Haiku 4.5に対して実施されました。モデルはローカルデプロイメントに必要なメモリ要件に応じてプロットされました。
技術仕様
- 量子化:Q4_K_M
- コンテキスト長:32K
- KVキャッシュ:q8_0
- VRAM推定:著者のカスタム計算機を使用して算出
主な発見
100GB未満のメモリを必要とするオープンウェイトモデルでは、いずれのベンチマークでもClaude Haikuの性能に近づくものはありませんでした。最も近い競合モデルはMinimax M2.5で、約136GBのメモリを必要とし、両ベンチマークでHaikuの性能とほぼ同等でした。
この分析は、コーディングタスクにおける100GB未満カテゴリーでのプロプライエタリモデルとオープンウェイトモデルの間の現在のギャップを浮き彫りにしています。著者はこの制限に不満を表明し、少なくともHaikuの能力に匹敵する小型モデルの開発を求めています。
📖 詳細なソースを読む: r/LocalLLaMA
👀 See Also

Google、Microsoft、xAI、AIモデルを早期に米国政府と共有することに合意
Google、Microsoft、xAI(イーロン・マスクのAI企業)は、米国政府による安全性テストのため、自社のAIモデルへの早期アクセスを自主的に提供することに合意した。これはウォール・ストリート・ジャーナルが報じたイニシアチブの一環である。

OpenClaw v2026.3.12 ダッシュボードの再設計により、インターフェース要素が統合されました。
OpenClaw v2026.3.12では、チャット、設定、エージェント、セッションのモジュールビュー、コマンドパレット、モバイル用下部タブ、スラッシュコマンド、検索、エクスポート、ピン留めメッセージを単一のインターフェースに統合したダッシュボードの完全な再設計が行われています。

カイザー看護師、AI監視が患者ケアを低下させると主張、契約交渉を控え
カイザー・パーマネンテの看護師らが、AIによる職場監視(通話時間追跡、生産性予測、共感スコアリング)により患者対応を急がされ、ケアの質が損なわれていると報告。自殺企図の患者との15分超の通話が管理職の批判を招いた事例も。

Subquadratic、AIモデル向け1200万トークンコンテキストウィンドウを発表
Subquadraticは1200万トークンのコンテキストウィンドウを発表し、LLM推論の従来の限界を打ち破り、コードベース全体を一括処理することを可能にしました。