NemoClawをローカルvLLMで実行する:セットアップメモとエージェントエンジニアリングの観察

vLLMを使用したローカルNemoClawセットアップ
開発者が、WSL2上でvLLMを使用してローカルのNemotron 9B v2モデルでNVIDIAのNemoClaw(サンドボックス化されたAIエージェントプラットフォーム)を実行した経験を共有しました。このセットアップは、jieunl24のNemoClawフォークに基づいています。
主要な技術的詳細
推論ルーティング: NemoClawの推論ルーティングは、明確なパスをたどります:inference.local → gateway → vLLM。ただし、初期のオンボーディングバグにより、3層ネットワークハックが必要でしたが、これはPR #412によって修正されました。
パーサー互換性: 組み込みのvLLMパーサー(qwen3_coder、nemotron_v3)は、Nemotron v2モデルと互換性がありません。代わりに、NeMoリポジトリからNVIDIAの公式プラグインパーサーを使用する必要があります。
エージェントエンジニアリングのギャップ: エージェントプラットフォームとしてのOpenClawは堅牢なインフラストラクチャを提供しますが、最小限のプロンプトエンジニアリングしか備えていません。「モデルがテキストを提供する」と「エージェントが有用な作業を行う」の間のギャップは、主にモデルの能力制限ではなく、スキャフォールディングに関するものです。
リソース
- アーキテクチャ、vLLMパーサーセットアップ、およびエージェントエンジニアリングの観察をカバーするブログ記事:https://github.com/soy-tuber/nemoclaw-local-inference-guide/blob/master/BLOG-openclaw-agent-engineering.md
- 推論.localルーティングとネットワークハックなしのセットアップガイド(V2):https://github.com/soy-tuber/nemoclaw-local-inference-guide
- 元のNemoClaw issue #315:https://github.com/NVIDIA/NemoClaw/issues/315
このセットアップは、AIエージェントプラットフォームの実用的なローカルデプロイメントを示しており、技術的な実装の詳細とエージェントエンジニアリングにおける継続的な課題の両方を強調しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

時間とともにあなたのプロジェクトを学習するClaudeコードのシステム
開発者が、CLAUDE.mdファイル、プロジェクトの規約を含むdocsフォルダ、およびブートストラップ、改善、パターン捕捉のための3つのプロンプトを追加することで、Claude Codeがセッション間でコンテキストを保持できるようにするシンプルな設定を作成しました。

Linki v2:自己ホストエージェントによるLinkedIn + コールドメールのためのオープンソースAI SDR
Linki v2はセルフホスト型のAI SDRで、LinkedInの自動化とコールドメールを1つのツールに統合。リードごとにパーソナライズされたメッセージをAIが自動作成します。シート単位の課金はなく、データはローカルに保存されます。

Krasis LLMランタイム、Llama.cppと比較して8.9倍のプリフィル速度と4.7倍のデコード速度向上を実現
Krasis LLMランタイムは、現在プレフィルとデコードの両方をGPU上で完全に実行し、それぞれに異なる最適化戦略を適用しています。これにより、単一の5090 GPUでQwen3.5-122Bを実行した場合、llama.cppと比較してプレフィル速度が8.9倍、デコード速度が4.7倍高速になりました。

Shieldbot: Claude Code用オープンソースセキュリティスキャナープラグイン
Shieldbotは、Claude Code内でプラグインとして動作するオープンソースのセキュリティスキャナーです。Semgrep(5,000以上のルール)、Bandit、Ruff、detect-secrets、pip-audit、npm auditの6つのスキャナーを統合し、重複する検出結果を排除して、リスクスコアとコード修正を含む優先順位付けされたレポートを生成します。