RTX 4070 SuperでQwen 3.6とGemma 4モデルを実行する:12GB VRAMベンチマーク

Redditユーザーが、12GBのRTX 4070 Super(+10% OC)とAMD 9800X3D CPU、64GB DDR5-6000 RAMを搭載したシステムで、複数の大規模MoEモデルを実行する速度ベンチマークを公開しました。ユーザーはVRAM節約のためディスプレイをiGPUにオフロードしており、そうしないと約10%のパフォーマンス低下があると述べています。セットアップはCUDA 13.1と最新のllama.cppを使用し、以下のハードウェア構成です。
n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true
ベンチマーク結果
ユーザーはVS CodeのClineとKiloCodeを用いて、Unsloth GGUF量子化で4つのモデルをテストしました(ツール呼び出しの問題なし)。すべての測定値はトークン/秒(tgs)と処理/秒(pps)です。
- Qwen3.6-35B-A3B-GGUF Q6_K_XL: 40 tgs, 2100 pps
- Qwen3.6-27B-IQ3_XXS: 16 tgs, 1000 pps
- Gemma 4 26B-A4B-it-UD-Q8: 26 tgs, 2150 pps
- Gemma-4-31B-it-IQ3_XXS: 13-16 tgs, 650 pps
注目すべき構成詳細
ユーザーは個々のモデル構成と特定のチューニングを共有しました。主なハイライト:
- Qwen3.6-35B-A3Bの場合:
n-cpu-moe = 35(35個のMoEエキスパートをCPUにオフロード)、cache-type-k = q8_0、cache-type-v = q8_0、swa-full = true、cache-reuse = 512、コンテキストサイズ131072、推論有効、予算8096。 - Gemma 4 26Bの場合:
n-cpu-moe = 27、コンテキスト102400、fit = on、fit-target = 256、fit-ctx = 32768。 - Gemma 4 31Bの場合:
ngram-modによる投機的デコード(spec-type = ngram-mod)、n-gpu-layers = 58(部分的なGPUオフロード)、cache-type-k = q4_0、no-kv-offload = true。 - すべてのモデルで
flash-attn = true、no-mmproj-offload = true。
ユーザーがWeb開発に好むモデルはQwen3.6-35B-A3Bで、VS Code拡張機能でツール呼び出しの問題がない品質を称賛しています。
📖 ソース全文を読む: r/LocalLLaMA
👀 See Also

Claude Code LSP セットアップガイド:構造的コード理解
Redditの投稿では、Claude Codeをテキストマッチングではなく構造的なコード理解のためにLanguage Server Protocolを使用するように設定する方法が詳しく説明されています。これにより、定義へのジャンプ、参照の検索、呼び出し階層などの機能でクエリ時間が30〜60秒から約50msに短縮されるとのことです。

一つのグループチャット内で二つのTelegramボットを橋渡しする:HTTP上の配信セマンティクス
ある開発者が、同じグループチャット内の2つの独立したTelegramボットを接続する実用的なアプローチを共有しています。Telegramのボット間配信ギャップに対処するため、HTTPリレー、ACK、重複排除、厳格なスコープ付きフィードを活用しています。

Claude AI実行エージェントのための実用的なプロンプト構造
開発者が、API呼び出し、データ抽出、マルチステップワークフローを実行するClaude AIエージェントの幻覚を減らしたプロンプトエンジニアリング技術を共有。主な戦略には、プロンプトを契約のように書くこと、トークンの40%をエラーハンドリングに割り当てること、『待機』と『停止』の条件を分けることが含まれます。

オープンクロー障害パターン:28日間で42件の実例
OpenClawを毎日実行している開発者が、AIの幻覚、認証の崩壊、時間を節約するどころかより多くの時間を消費する自動化など、8つのカテゴリーにわたる42の具体的な失敗を記録しました。ソースには、Google OAuthの7日間トークン有効期限切れや、Opus 4.6がファイルに不要なメタデータを追加するといった具体的な例が含まれています。