FOMOEにより、2,100ドルのデスクトップハードウェアで397B Qwen3.5モデルの推論が可能に

FOMOEが解決する課題
大規模なMixture of Experts(MoE)モデルは、通常NVMeのようなフラッシュメモリに数百GBの重みストレージを必要とします。推論中には重みのごく一部しか必要とされませんが、事前にどの重みが必要かを予測することはできません。ランダムアクセスパターンにより、フラッシュメモリの遅延が高くなり、コンシューマーハードウェアでの実用的な推論が困難になります。
FOMOEの仕組み
このシステムは、いくつかの技術により、ほとんどのエキスパート重みの読み取りを不要にします:
- 最新のローディングエキスパートキャッシュを使用して、最も一般的なエキスパートをGPUメモリ(VRAM)に保存
- ウォームスタートで60%のVRAMヒット率を達成し、NVMe読み取りを28%に削減(12%はDRAMから提供)
- 重みのロードと計算をオーバーラップさせるデュアルGPUピンポンアーキテクチャを採用
- キャッシュ対応ルーティング(CAR)を実装 - 2つのエキスパートのスコアが類似している場合、許容範囲内でVRAMまたはDRAMキャッシュに既にある次善のスコアのエキスパートを選択
性能結果
- Qwen3.5の3970億パラメータモデルで毎秒5〜9トークンの推論速度
- CAR有効時、NVMe読み取りを7%に削減
- wikitextでの測定でパープレキシティの低下はわずか3.5%
- ハードウェア要件:2台の500ドルGPU、32GB RAM、1台のNVMeドライブ
- Q4_K_M量子化を使用
実装は、人間の強力なガイダンスのもと、Claudeが主導する約15,000行のC/HIPコードで構成されています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Shieldbot: Claude Code用オープンソースセキュリティスキャナープラグイン
Shieldbotは、Claude Code内でプラグインとして動作するオープンソースのセキュリティスキャナーです。Semgrep(5,000以上のルール)、Bandit、Ruff、detect-secrets、pip-audit、npm auditの6つのスキャナーを統合し、重複する検出結果を排除して、リスクスコアとコード修正を含む優先順位付けされたレポートを生成します。

nah: Claude Code向けの文脈を考慮した権限ガード
nahはClaude Code内のすべてのツール呼び出しを傍受するPreToolUseフックで、filesystem_readやgit_history_rewriteなどのアクションタイプでコマンドを分類し、コンテキストに基づいてポリシーを適用します。決定論的分類器をミリ秒単位で実行し、曖昧なケースにはオプションでLLMエスカレーションを行います。

Claude Code プラグイン /verify: 計画から自動ブラウザテストを実行
/verifyは、あなたの計画を読み取り、Playwright MCPを介して実際のブラウザを起動し、各要件をチェックして、スクリーンショット付きの合格/不合格レポートを提供するオープンソースのClaude Codeプラグインです。

Claude Code vs OpenCode:開発者が発見した主要な技術的相違点
ある開発者がClaude CodeとOpenCodeをコンテキスト、メモリ、ツール使用、サブエージェント、権限、安全性、モデルの柔軟性について比較し、本番リポジトリではClaude Codeが依然として優れていると結論づけています。