Qwen 3.5 35Bを8GB VRAMでllama.cpp構成で実行中

限られたVRAMでのローカルQwen 3.5 35Bセットアップ
r/LocalLLaMAの開発者が、8GB VRAMのハードウェアでQwen 3.5 35Bモデルをローカル実行する設定を詳細に説明。クラウドサービスの制限に直面した後、Antigravity(Google AI Proプラン使用)からローカルLLMへ移行しました。
ハードウェアとモデル仕様
このセットアップは、i9-14900HX CPU(BIOSでEコア無効化、32GB DDR5 RAM)と8GB VRAMのRTX 4060m GPUを搭載したLenovo Legionノートパソコンを使用。具体的なモデルはQwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF)です。
パフォーマンスとllama.cpp設定
開発者はこのセットアップで、プロンプト処理で約700トークン/秒、トークン生成で42トークン/秒を達成したと報告。テスト後のllama.cppコマンドライン引数を提供:
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
ワークフロー統合
エージェントワークフローでは、Antigravityに最も近い代替としてVSCodeのClineを見つけました。このセットアップ内で、Planモードにはkat-coder-proを、Actモードにはqwen3.5を使用。開発者は、プライバシー懸念よりもスムーズなワークフローを優先し、このローカル設定がGoogle Gemini 3 FlashをAntigravityで使い続けるよりも優れているかについてフィードバックを求めています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

HyperResearch:オープンソースのClaude Codeスキルハーネスがそれを深層研究エージェントに変える
HyperResearchは、Claude Codeを16ステップのディープリサーチパイプラインに変換し、永続的な知識ストア、ファクトチェック、認証済みウェブセッションを提供します。オープンソースで単一コマンドでインストール可能。DeepResearch BenchでOpenAIやGoogleを上回ります。

OpenClaw Budget Guard Pluginは、同時予算超過支出を防止します。
新しいOpenClawプラグイン「@runcycles/openclaw-budget-guard」は、アトミックな残高チェック、実行前の予約、冪等性のあるリトライを実装することで、同時実行時の予算超過問題を解決します。Redisを備えたCyclesサーバーが必要で、bashコマンドからインストールできます。

Claudeを使用してCapacitor WebViewsでモバイルアプリのQAを自動化する
ある開発者が、CapacitorベースのモバイルアプリをAndroidとiOSでテストするためにClaudeを使用した自動QAシステムを構築しました。このアプローチでは、Android WebViewにはChrome DevTools Protocolを、スクリーンショットによる視覚的分析を採用しており、Androidのセットアップは90分で完了したのに対し、iOSには6時間以上を要しました。

Caliby:面向AI代理的开源嵌入式向量数据库,支持文本+向量混合存储
Calibyは、Pythonバインディング(pip install caliby)を備えたC++組み込みベクトルデータベースです。HNSW、DiskANN、IVF+PQインデックスをサポートし、pgvector比4倍のパフォーマンスを主張。AIエージェント/RAGユースケース向けに、テキストをベクトルと一緒にネイティブに保存します。