Qwen 3.5 35Bを8GB VRAMでllama.cpp構成で実行中

限られたVRAMでのローカルQwen 3.5 35Bセットアップ
r/LocalLLaMAの開発者が、8GB VRAMのハードウェアでQwen 3.5 35Bモデルをローカル実行する設定を詳細に説明。クラウドサービスの制限に直面した後、Antigravity(Google AI Proプラン使用)からローカルLLMへ移行しました。
ハードウェアとモデル仕様
このセットアップは、i9-14900HX CPU(BIOSでEコア無効化、32GB DDR5 RAM)と8GB VRAMのRTX 4060m GPUを搭載したLenovo Legionノートパソコンを使用。具体的なモデルはQwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF)です。
パフォーマンスとllama.cpp設定
開発者はこのセットアップで、プロンプト処理で約700トークン/秒、トークン生成で42トークン/秒を達成したと報告。テスト後のllama.cppコマンドライン引数を提供:
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
ワークフロー統合
エージェントワークフローでは、Antigravityに最も近い代替としてVSCodeのClineを見つけました。このセットアップ内で、Planモードにはkat-coder-proを、Actモードにはqwen3.5を使用。開発者は、プライバシー懸念よりもスムーズなワークフローを優先し、このローカル設定がGoogle Gemini 3 FlashをAntigravityで使い続けるよりも優れているかについてフィードバックを求めています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

FOMOEにより、2,100ドルのデスクトップハードウェアで397B Qwen3.5モデルの推論が可能に
FOMOE(Fast Opportunistic Mixture of Experts)は、Q4_K_M量子化を使用し、2台の500ドルGPU、32GB RAM、NVMeドライブを備えたコンシューマーハードウェアで、Qwen3.5の3970億パラメータのフラッグシップモデルを毎秒5〜9トークンの速度で実行可能にします。

カーペイシーの自動研究を16GPUでスケーリング:結果と手法
SkyPilotチームは、Kubernetesクラスター上の16個のGPUにClaude Codeをアクセスさせ、KarpathyのAutoresearchプロジェクトを実行しました。8時間以上にわたり、エージェントは約910件の実験を提出し、検証ビット/バイトを1.003から0.974に改善(2.87%向上)し、逐次実行よりも9倍速く最高の検証損失に到達しました。

テラリウム:エイジェンティック環境のためのタイムマシン・リワインド機能付きオープンソースサンドボックス
複数のAIエージェントを安全に実行できる多用途サンドボックス。分離されたワールド、リバースプロキシ管理、GUI、タイムマシン機能でコンテナ状態を巻き戻せます。
Refine CycleプラグインでOpenClawエージェントが繰り返すミスから学習できるようになる
Refine Cycleは、OpenClawエージェントの最近のセッションをスキャンして繰り返されるミスを検出し、エージェントが今後参照する短い教訓を1つ作成し、そのエラーが再発するかどうかを検証します。Prime IntellectのPrime Agentを/refineとして適応させたものです。