RTX 4070 SuperでQwen 3.6とGemma 4モデルを実行する:12GB VRAMベンチマーク

✍️ OpenClawRadar📅 公開日: April 30, 2026🔗 Source
RTX 4070 SuperでQwen 3.6とGemma 4モデルを実行する:12GB VRAMベンチマーク
Ad

Redditユーザーが、12GBのRTX 4070 Super(+10% OC)とAMD 9800X3D CPU、64GB DDR5-6000 RAMを搭載したシステムで、複数の大規模MoEモデルを実行する速度ベンチマークを公開しました。ユーザーはVRAM節約のためディスプレイをiGPUにオフロードしており、そうしないと約10%のパフォーマンス低下があると述べています。セットアップはCUDA 13.1と最新のllama.cppを使用し、以下のハードウェア構成です。

n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true

ベンチマーク結果

ユーザーはVS CodeのClineとKiloCodeを用いて、Unsloth GGUF量子化で4つのモデルをテストしました(ツール呼び出しの問題なし)。すべての測定値はトークン/秒(tgs)と処理/秒(pps)です。

  • Qwen3.6-35B-A3B-GGUF Q6_K_XL: 40 tgs, 2100 pps
  • Qwen3.6-27B-IQ3_XXS: 16 tgs, 1000 pps
  • Gemma 4 26B-A4B-it-UD-Q8: 26 tgs, 2150 pps
  • Gemma-4-31B-it-IQ3_XXS: 13-16 tgs, 650 pps
Ad

注目すべき構成詳細

ユーザーは個々のモデル構成と特定のチューニングを共有しました。主なハイライト:

  • Qwen3.6-35B-A3Bの場合:n-cpu-moe = 35(35個のMoEエキスパートをCPUにオフロード)、cache-type-k = q8_0、cache-type-v = q8_0、swa-full = true、cache-reuse = 512、コンテキストサイズ131072、推論有効、予算8096。
  • Gemma 4 26Bの場合:n-cpu-moe = 27、コンテキスト102400、fit = on、fit-target = 256、fit-ctx = 32768。
  • Gemma 4 31Bの場合:ngram-modによる投機的デコード(spec-type = ngram-mod)、n-gpu-layers = 58(部分的なGPUオフロード)、cache-type-k = q4_0、no-kv-offload = true。
  • すべてのモデルでflash-attn = true、no-mmproj-offload = true。

ユーザーがWeb開発に好むモデルはQwen3.6-35B-A3Bで、VS Code拡張機能でツール呼び出しの問題がない品質を称賛しています。

📖 ソース全文を読む: r/LocalLLaMA

Ad

👀 See Also

Claude Code LSP セットアップガイド:構造的コード理解
Guides

Claude Code LSP セットアップガイド:構造的コード理解

Redditの投稿では、Claude Codeをテキストマッチングではなく構造的なコード理解のためにLanguage Server Protocolを使用するように設定する方法が詳しく説明されています。これにより、定義へのジャンプ、参照の検索、呼び出し階層などの機能でクエリ時間が30〜60秒から約50msに短縮されるとのことです。

OpenClawRadar
一つのグループチャット内で二つのTelegramボットを橋渡しする:HTTP上の配信セマンティクス
Guides

一つのグループチャット内で二つのTelegramボットを橋渡しする:HTTP上の配信セマンティクス

ある開発者が、同じグループチャット内の2つの独立したTelegramボットを接続する実用的なアプローチを共有しています。Telegramのボット間配信ギャップに対処するため、HTTPリレー、ACK、重複排除、厳格なスコープ付きフィードを活用しています。

OpenClawRadar
Claude AI実行エージェントのための実用的なプロンプト構造
Guides

Claude AI実行エージェントのための実用的なプロンプト構造

開発者が、API呼び出し、データ抽出、マルチステップワークフローを実行するClaude AIエージェントの幻覚を減らしたプロンプトエンジニアリング技術を共有。主な戦略には、プロンプトを契約のように書くこと、トークンの40%をエラーハンドリングに割り当てること、『待機』と『停止』の条件を分けることが含まれます。

OpenClawRadar
オープンクロー障害パターン:28日間で42件の実例
Guides

オープンクロー障害パターン:28日間で42件の実例

OpenClawを毎日実行している開発者が、AIの幻覚、認証の崩壊、時間を節約するどころかより多くの時間を消費する自動化など、8つのカテゴリーにわたる42の具体的な失敗を記録しました。ソースには、Google OAuthの7日間トークン有効期限切れや、Opus 4.6がファイルに不要なメタデータを追加するといった具体的な例が含まれています。

OpenClawRadar