Gemma 4 31Bは、FoodTruck Benchにおいてより大規模なモデルを凌駕する性能を発揮します。

ベンチマーク結果と分析
Gemma 4 31BはFoodTruck Benchベンチマークで3位を獲得し、いくつかのより大規模で確立されたモデルを上回りました。Redditでの議論によると、このモデルはGLM 5、Qwen 3.5 397B、およびすべてのClaude Sonnetバリアントを凌駕しました。
FoodTruck Benchは、複雑な多段階計画タスクにおいて言語モデルをテストするベンチマークです。投稿者は、Gemma 4のパフォーマンスが、ベンチマークを完了できなかった以前のモデルよりも長期的なタスクをより適切に処理することを示唆していると推測しています。具体的には、このモデルはタスクシーケンスの後続ステップを計画する際に、自身のアドバイスを効果的に聞き入れるようです。
この結果は注目に値します。なぜなら、Gemma 4 31Bは、それが上回ったいくつかのモデルよりも大幅に小規模だからです。例えば、Qwen 3.5 397Bは、Gemma 4 31Bよりも約12.8倍多くのパラメータを持っています。このパフォーマンスは、特定の種類の推論タスクにおいては、モデルアーキテクチャとトレーニングアプローチがパラメータ数と同じくらい重要である可能性を示唆しています。
FoodTruck Benchは、拡張された一連のアクションにわたってコンテキストを維持する必要がある実用的な計画シナリオでモデルをテストします。このベンチマークの設計は、現実世界のアプリケーションで多段階タスクを実行する必要があるAIエージェントを扱う開発者にとって特に関連性が高いものです。
📖 Read the full source: r/LocalLLaMA
👀 See Also

LinuxサウンドサブシステムにAIアシスト修正が殺到:IRQ、UAF、およびクワークス
Takashi Iwai 氏の最新の Linux 7.1 サウンドプルリクエストには、Claude Code や GPT-5.5 による「assisted-by」パッチが多数含まれており、HD オーディオの IRQ 処理、UAF バグ、デバイス quirks の修正が行われています。

PwC 2026年CEO調査:AIから財務的リターンゼロと報告した企業は56%、成功はわずか12%
PwCは95カ国の4,454人のCEOを対象に調査を行い、56%がAIによる財務的影響を全く感じていないと報告している一方で、コスト削減と収益拡大の両方にAIを成功裏に活用しているのはわずか12%のみであることを明らかにしました。成功を収めている『バンガード』企業は、AIを製品やサービスに直接適用する可能性が3倍高いことが分かりました。

Claude Code v2.1.86:セッションヘッダー、メモリ修正、トークン最適化
Claude Code v2.1.86は、プロキシ集約のためのX-Claude-Code-Session-Idヘッダーの追加、長時間セッションでのメモリ増加の修正、@を使用したファイル言及時のトークンオーバーヘッドの削減を実装しました。このリリースでは、Windowsでの設定ファイル破損やOAuth URLコピー問題を含む18の特定の問題に対処しています。

Anthropicは、OpenClawを含むサードパーティ製ハーネスでのClaudeサブスクリプション利用を制限しています。
Anthropicは、4月4日午後12時(太平洋時間)/午後8時(BST)から、Claudeのサブスクリプション制限をOpenClawなどのサードパーティ製ハーネスで使用できなくなると発表しました。ユーザーはこれらの統合に別途従量課金を有効にして追加利用を行う必要があります。