Redditユーザーが、Zen 4でQwen 3 30B Q4のCPU推論が18.8 tok/sを報告

Redditユーザーが、高価なGPUハードウェアに投資する代わりに、CPUでのローカルLLM推論をテストした経験を共有しました。
主な詳細
ユーザーは、ローカルLLM推論用のGPUハードウェア購入を検討しており、以下の選択肢を考えていました:
- P40 GPU
- V100 GPU(通常のマザーボードに接続できないSXM2バージョンを購入するところでした)
- RTX 3090(AI需要により800ドル以上で販売)
まずCPU推論を試すようアドバイスを受けた後、以下のテストを実施:
- モデル: Qwen 3 30B Q4
- ハードウェア: Zen 4プロセッサとDDR5メモリ
- 性能: CPUで18.8トークン/秒
- 予想と現実: 3-5トークン/秒を予想していたが、約19トークン/秒を達成
ユーザーは「Zen 4 + DDR5は推論に最適だ」と述べています。
実践的テスト結果
ユーザーは実際のコーディングタスク比較を実施:
- 8Bモデルは「自信を持って完全に間違ったコードを生成」
- 30Bモデルは「最初の試行で完璧に成功」
- 30Bモデルの性能を「基本的にGPT-4oレベルを無料で実現」と評価
これは、特定のコーディングタスクにおいて、適切に量子化された30Bモデルを最新CPUハードウェアで実行することで、ローカルLLM推論に通常関連付けられるハードウェア投資なしに、大規模なクラウドベースモデルに匹敵する結果が得られる可能性を示唆しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude vs GPT-4o: 同一の二重振り子プロンプト、異なる座標系の慣例
ClaudeとGPT-4oは、同じレンダラーを使用しながら、θをそれぞれ上向きと下向きの垂直線から解釈するため、視覚的に異なる二重振り子シミュレーションを生成します。どちらの場合も数学的には正しいですが、この不一致はプロンプト解釈における微妙な曖昧さを明らかにしています。

NVIDIAがOpenShellセキュリティ機能を備えたNemoClawを発表
NVIDIAはGTCでNemoClawを発表し、OpenClawを基盤として、AIエージェント向けにポリシーベースのプライバシーとセキュリティガードレールを実施するOpenShellを通じて、エンタープライズレベルのセキュリティを追加しました。

AIが世界を喰らう(2026年春季) - 包括的市場分析
AI業界のトレンド、市場規模、導入指標について詳細に解説した2026年春版のPDFレポート。主要技術、プレイヤー、予測を網羅。

開発者、8GB VRAMでのEmbed、Rerank、およびZero-Shotモデルの提供に関するアーキテクチャのアドバイスを求める
ローカルコーディングエージェント向けの統合ナレッジグラフ/RAGサービスを構築している開発者が、8GB VRAMと16GBシステムRAMのメモリ制約に苦しんでおり、3つのトランスフォーマーモデルを同時に提供する際にOOMエラー、レイテンシースパイク、Linuxカーネルによる強制終了が発生しています。