6GB VRAMでQwen3.6 27Bと35Bをik_llamaで実行:実用的な設定とベンチマーク

Redditユーザーが、RTX 2060 Mobile(6 GB VRAM)と32 GB RAMを搭載した旧型ゲーミングノートPCで、ik_llamaとllama.cppを使用してQwen3.6 27Bおよび35B A3Bモデルの実行に成功したと報告。主な最適化として、MTPとngramによる二重投機的デコード、--fitと--mtp-requantize-output-tensor、さらに出力テンソルの再パッキングが含まれます。以下が正確な設定と観測された速度です。
Qwen3.6 27B(Q3_K_XL)の設定
export GGML_CUDA_GRAPHS=1
./llama-server \
-m /mnt/second-ssd/lib/llama.cpp/models/Qwen3.6-27B-MTP-UD-Q3_K_XL.gguf \
-c 16000 \
-b 512 -ub 512 \
--fit --fit-margin 3076 \
-fa on \
-np 1 \
-ctk q4_0 -ctv q4_0 \
--mtp-requantize-output-tensor q4_0 \
-khad -vhad -rtr \
--threads 6 --threads-batch 8 \
--slot-save-path ./slots \
--prompt-cache "prompt.cache" \
--port 8888 --host 0.0.0.0 \
--spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
--spec-stage mtp:n_max=1,draft-p-min=0.0 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true}' \
--reasoning on
Qwen3.6 35B A3B(IQ4_XS、Claude Opus蒸留)の設定
export GGML_CUDA_GRAPHS=1
./llama-server \
-m /mnt/second-ssd/lib/llama.cpp/models/lordx64-Claude-4.7-Opus-Reasoning-Distilled-Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf \
-c 80000 \
-b 1024 -ub 1024 \
--fit --fit-margin 2048 \
-fa on \
-np 1 \
-ctk q8_0 -ctv q4_0 \
--mtp-requantize-output-tensor q4_0 \
-khad -vhad -rtr \
--threads 6 --threads-batch 8 \
--slot-save-path ./slots \
--prompt-cache "prompt.cache" \
--mlock --no-mmap \
--port 8888 --host 0.0.0.0 \
--spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
--spec-stage mtp:n_max=3,draft-p-min=0.0 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true}' \
--reasoning on
パフォーマンス数値
- 27B: プリフィル約100 t/s、最初のトークン最大4 t/s、10kコンテキストで約1 t/s
- 35B A3B: プリフィル約40 t/s、最初のトークン最大15 t/s、10kコンテキストで常に約11 t/s
ユーザーによると、27Bでは最大1000行のファイルの推論が実用的になり(数分かかるが有用)、35B Opus蒸留モデルは安定した11 t/sの出力速度を維持。これを使用して、little-coderやエージェント的なコーディングワークフローで、mermaid図、画像、マークダウン、PDFを生成しているとのこと。
📖 出典全文: r/LocalLLaMA
👀 See Also

OpenClaw + Ollama ローカルモデルのタイムアウトをデバッグ:サイレント障害に対する5つの修正方法
開発者が、OpenClawエージェントがGemma 4 26BなどのローカルOllamaモデルで暗黙的にタイムアウトする5つの根本原因を特定しました。これには、ブロッキングスラッグジェネレーター、38K文字のシステムプロンプト、隠れたタイムアウトが含まれます。修正には、フックの無効化、設定の変更、Ollama設定の調整が含まれます。

12の効率的なAIエージェントワークフロー向けOpenClawパワーユーザーのコツ
Redditの投稿では、OpenClawの使用を最適化するための実践的な戦略が概説されています。これには、会話をトピック別のスレッドに分割する、音声メモを入力に使用する、タスクに適したモデルを選択する、作業をサブエージェントに委任する、セキュリティレイヤーを実装するなどが含まれます。

Claude Code向けのスキル作成原則(159のオープンソーススキルから)
開発者が、159のスキルを持つオープンソースのスキルレジストリを構築・維持する中で得た、Claude Code向けの効果的なスキル作成のための10の原則を公開しました。これらの原則は、実際のエージェントの使用状況から観察された実用的な実装パターンに焦点を当てています。

ソロスタジオ向けClaudeスキル9選:実務で使える命令の積み重ね方
ある個人開発者が、動画制作、分析、SEO、財務モデリングなどのために9つのClaudeスキルを構築しました。重要なポイント:スキルはドキュメントではなく、経験豊富な同僚への指示として書くこと。スキルはタスクが重なると自動的にトリガーされ、スタックします。