Qwen 3.5 35Bを8GB VRAMでllama.cpp構成で実行中

限られたVRAMでのローカルQwen 3.5 35Bセットアップ
r/LocalLLaMAの開発者が、8GB VRAMのハードウェアでQwen 3.5 35Bモデルをローカル実行する設定を詳細に説明。クラウドサービスの制限に直面した後、Antigravity(Google AI Proプラン使用)からローカルLLMへ移行しました。
ハードウェアとモデル仕様
このセットアップは、i9-14900HX CPU(BIOSでEコア無効化、32GB DDR5 RAM)と8GB VRAMのRTX 4060m GPUを搭載したLenovo Legionノートパソコンを使用。具体的なモデルはQwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF)です。
パフォーマンスとllama.cpp設定
開発者はこのセットアップで、プロンプト処理で約700トークン/秒、トークン生成で42トークン/秒を達成したと報告。テスト後のllama.cppコマンドライン引数を提供:
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
ワークフロー統合
エージェントワークフローでは、Antigravityに最も近い代替としてVSCodeのClineを見つけました。このセットアップ内で、Planモードにはkat-coder-proを、Actモードにはqwen3.5を使用。開発者は、プライバシー懸念よりもスムーズなワークフローを優先し、このローカル設定がGoogle Gemini 3 FlashをAntigravityで使い続けるよりも優れているかについてフィードバックを求めています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

HostMyClaudeHTML:Claude HTMLアーティファクトのワンクリック共有
開発者がhostmyclaudehtml.comを構築しました。これは、Claudeが生成したHTML成果物を.htmlファイルをドラッグ&ドロップするだけでライブURLとして共有できる無料ツールです。アップロード者も閲覧者もアカウントは必要ありません。

OpenTrace:75以上のMCPツールを備えたセルフホスト型オブザーバビリティサーバー
OpenTraceは、75以上のMCPツールを通じてログ、ユーザー分析、データベース内省を提供するセルフホスト型オブザーバビリティサーバーで、SQLiteストレージと読み取り専用Postgres接続を備えた4ドルのVPS上で動作します。

Claudeコード用カスタム出力スタイルコレクション
開発者がClaude Code向けに13種類のカスタム出力スタイルを作成しました。これらはシステムプロンプトを通じてAIの挙動を変更するもので、コードを厳しく批評する「Roast」、質問で導く「Socratic」、敵対的テストを行う「Breaker」、実用的解決策を提案する「Ship It」、セキュリティ重視の「Paranoid」、テスト駆動開発の「TDD」などが含まれます。

14種類のクローAIエージェントの10カテゴリにわたる比較
OpenClaw、NanoClaw、NemoClaw、ZeroClaw、PicoClaw、Moltis、IronClaw、NullClawを含む14の人気Claw AIエージェントの詳細な比較。53のサブパラメータに基づくスコアリング、総合ランキング、および各エージェントの理想的な使用例を紹介。