Redditユーザーが、Zen 4でQwen 3 30B Q4のCPU推論が18.8 tok/sを報告

Redditユーザーが、高価なGPUハードウェアに投資する代わりに、CPUでのローカルLLM推論をテストした経験を共有しました。
主な詳細
ユーザーは、ローカルLLM推論用のGPUハードウェア購入を検討しており、以下の選択肢を考えていました:
- P40 GPU
- V100 GPU(通常のマザーボードに接続できないSXM2バージョンを購入するところでした)
- RTX 3090(AI需要により800ドル以上で販売)
まずCPU推論を試すようアドバイスを受けた後、以下のテストを実施:
- モデル: Qwen 3 30B Q4
- ハードウェア: Zen 4プロセッサとDDR5メモリ
- 性能: CPUで18.8トークン/秒
- 予想と現実: 3-5トークン/秒を予想していたが、約19トークン/秒を達成
ユーザーは「Zen 4 + DDR5は推論に最適だ」と述べています。
実践的テスト結果
ユーザーは実際のコーディングタスク比較を実施:
- 8Bモデルは「自信を持って完全に間違ったコードを生成」
- 30Bモデルは「最初の試行で完璧に成功」
- 30Bモデルの性能を「基本的にGPT-4oレベルを無料で実現」と評価
これは、特定のコーディングタスクにおいて、適切に量子化された30Bモデルを最新CPUハードウェアで実行することで、ローカルLLM推論に通常関連付けられるハードウェア投資なしに、大規模なクラウドベースモデルに匹敵する結果が得られる可能性を示唆しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

週刊r/ClaudeAI サバイバルガイド:Opus 4.7、課金バグ、データベース削除インシデント
Wilsonの週刊サバイバルガイドは、r/ClaudeAIのトップスレッド(50コメント以上)を実践的な教訓に凝縮:Opus 4.7の議論、gitファイル名が引き金となった200ドルの請求バグ、9秒でデータベース全体を削除したAIエージェント、そしてCopilotのClaudeモデル9倍値上げ。

Claude-Code v2.1.105 リリース:ワークツリーの改善、プラグインモニター、およびUI修正
Claude-Code v2.1.105は、既存のワークツリーに切り替えるためのpathパラメータをEnterWorktreeツールに追加し、モニターマニフェストキーによるプラグインのバックグラウンドモニターサポートを導入し、UI表示の問題、MCPサーバー処理、ターミナル互換性を含む30以上の問題を修正しました。

Claude Coworkの使用上限が7月5日まで10時間に倍増
Anthropicは、Claude Coworkの使用制限を5時間から10時間に倍増し、今後1ヶ月間すべての有料プランで適用すると発表。デスクトップアプリで7月5日まで利用可能。

ラブアブルは、国際女性デーを記念して、24時間無料アクセスと350ドル分のパートナークレジットを提供します。
Lovableは、24時間の無料ビルディングアクセスに加え、AnthropicからのClaude APIトークン100ドル分とStripeの決済手数料クレジット250ドル分を提供しています。このオファーは3月9日午前0時59分に終了します。