OmniCoder-9Bをローカルで実行するためのllama.cpp設定詳細

✍️ OpenClawRadar📅 公開日: March 14, 2026🔗 Source
OmniCoder-9Bをローカルで実行するためのllama.cpp設定詳細
Ad

ハードウェルとモデル設定

この設定では中程度のハードウェルを使用しています:AMD Ryzen 9 5900X CPU(推論に12スレッド使用)、62GB DDR4 RAM、NVIDIA RTX 3080(10GB VRAM)、NVMe SSD、リモートサーバー上のUbuntu 22.04。

モデルはOmniCoder-9Bで、Qwen3.5-9Bをベースに、Tesslateによる425k以上のコーディングエージェント軌跡でファインチューニングされています。Q6_K量子化(ファイルサイズ6.85GB)を使用し、128Kトークンのコンテキストウィンドウを持ち、HuggingFaceから入手されています。

llama.cpp設定

モデルは以下の特定のフラグでllama.cppサーバーを介して実行されます:

llama-server \
--model /home/openclaw/models/omnicoder-9b/omnicoder-9b-q6_k.gguf \
--host 0.0.0.0 --port 8080 \
--ctx-size 131072 \
--n-gpu-layers 99 \
--cache-type-k q8_0 \
--cache-type-v q4_0 \
--threads 12 \
--batch-size 128 \
--flash-attn on \
--temp 0.4 \
--top-k 20 \
--top-p 0.95 \
--jinja \
--reasoning-budget 0

主要パラメータの説明:

  • --ctx-size 131072:大規模なコードベース用の128Kコンテキストウィンドウ
  • --n-gpu-layers 99:すべてのレイヤーをGPUにオフロード
  • --cache-type-k q8_0 --cache-type-v q4_0:圧縮KVキャッシュで10GB VRAM内に128Kコンテキストを収納
  • --threads 12:物理コア数に一致(ハイパースレッドではない)
  • --flash-attn on:高速なアテンション計算
  • --reasoning-budget 0:reasoning_contentフィールドでの連鎖思考出力を無効化し、モデルが直接コードを出力するようにする
Ad

パフォーマンスとテスト

パフォーマンス指標:プロンプト評価は約300トークン/秒、生成は約80-90トークン/秒、VRAM使用量は約8.5GB/10GB、典型的なコーディングタスクのレイテンシは1-5秒。

テストは、自律エージェントフレームワークであるAgent Zeroによって実施されました。Agent ZeroはGLM-5を主要な頭脳として使用し、--reasoning-budget 0フラグを発見し、リモートサーバーにSSH接続し、systemdサービスを更新し、ベンチマークスクリプトを一から作成し、複数のベンチマーク(HumanEval base、HumanEval Pro、MBPP、MultiPL-E)を実行し、プロンプトエンジニアリングを繰り返しました。

ベンチマーク結果

公式主張との比較によるベンチマーク結果:

  • HumanEval base:公式92.7%、実行1:100%、実行2:95%、実行3:95%、平均:96.7%
  • HumanEval Pro:公式70.1%、実行1:70%、平均:70%

HumanEval baseの平均スコア96.7%は公式の92.7%を上回り、HumanEval Proは70%で完全に一致しました。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

OpenClawノードセットアップによるリモートブラウザ自動化の修正
Guides

OpenClawノードセットアップによるリモートブラウザ自動化の修正

CDP/RDPの面倒を避けるためにローカルのOpenClawノードを使う — ブラウザを可視状態で実行し、IPとクッキーを保持。

OpenClawRadar
React NativeでのオンデバイスAI構築から得られる実践的な教訓
Guides

React NativeでのオンデバイスAI構築から得られる実践的な教訓

開発者が、オンデバイスLLM、画像生成、音声文字起こし、ビジョンAIを備えたReact Nativeアプリ構築から得た具体的な技術詳細を共有。メモリ管理戦略、ライブラリ選択、パフォーマンスベンチマークを含む。

OpenClawRadar
ガイド:Lemonadeサーバーを介してWindowsでローカルLLMとGitHub Copilotを実行する方法
Guides

ガイド:Lemonadeサーバーを介してWindowsでローカルLLMとGitHub Copilotを実行する方法

ある開発者が、Framework DesktopでLemonade Serverを使用してGitHub CopilotをローカルLLMと連携させるための手順を公開しました。これは、Windowsでのこの設定に関する簡単な手順が見つからなかったため作成されました。

OpenClawRadar
Windows 11 HomeでのClaude Cowork「ワークスペースの起動に失敗しました」エラーの修正
Guides

Windows 11 HomeでのClaude Cowork「ワークスペースの起動に失敗しました」エラーの修正

ユーザーは、Windows 11 HomeでClaude Coworkの起動エラーを解決するために、Microsoft StoreからWindows Subsystem for Linux (WSL2)をインストールしました。これは基盤となるVMテクノロジーに必要です。

OpenClawRadar