NemoClawをローカルvLLMで実行する:セットアップメモとエージェントエンジニアリングの観察

✍️ OpenClawRadar📅 公開日: March 20, 2026🔗 Source
NemoClawをローカルvLLMで実行する:セットアップメモとエージェントエンジニアリングの観察
Ad

vLLMを使用したローカルNemoClawセットアップ

開発者が、WSL2上でvLLMを使用してローカルのNemotron 9B v2モデルでNVIDIAのNemoClaw(サンドボックス化されたAIエージェントプラットフォーム)を実行した経験を共有しました。このセットアップは、jieunl24のNemoClawフォークに基づいています。

主要な技術的詳細

推論ルーティング: NemoClawの推論ルーティングは、明確なパスをたどります:inference.local → gateway → vLLM。ただし、初期のオンボーディングバグにより、3層ネットワークハックが必要でしたが、これはPR #412によって修正されました。

パーサー互換性: 組み込みのvLLMパーサー(qwen3_codernemotron_v3)は、Nemotron v2モデルと互換性がありません。代わりに、NeMoリポジトリからNVIDIAの公式プラグインパーサーを使用する必要があります。

エージェントエンジニアリングのギャップ: エージェントプラットフォームとしてのOpenClawは堅牢なインフラストラクチャを提供しますが、最小限のプロンプトエンジニアリングしか備えていません。「モデルがテキストを提供する」と「エージェントが有用な作業を行う」の間のギャップは、主にモデルの能力制限ではなく、スキャフォールディングに関するものです。

Ad

リソース

このセットアップは、AIエージェントプラットフォームの実用的なローカルデプロイメントを示しており、技術的な実装の詳細とエージェントエンジニアリングにおける継続的な課題の両方を強調しています。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Tendr Skill: エージェントメモリ管理のための決定論的CLI操作
Tools

Tendr Skill: エージェントメモリ管理のための決定論的CLI操作

Tendr Skillは、構造化された長期記憶のために推論と実行を分離するエージェントスキルであり、エージェントが変更すべきことを決定し、CLIツールが構造的な操作を確定的に処理することを可能にします。[[ウィキリンク]]とファイル間の明示的な意味的階層をサポートしています。

OpenClawRadar
ジーヴス:AIエージェントセッションの閲覧と再開のためのTUI
Tools

ジーヴス:AIエージェントセッションの閲覧と再開のためのTUI

Jeevesは、Claude Code、Codex、OpenCodeのAIエージェントセッションを単一のビューで検索、プレビュー、再開できるターミナルユーザーインターフェースです。Goで書かれており、Homebrew、Nix、Go installなどの複数のパッケージマネージャーで利用できます。

OpenClawRadar
Apple Siliconにおける長い会話のためのKVキャッシュ再利用により、200倍の高速化を実現
Tools

Apple Siliconにおける長い会話のためのKVキャッシュ再利用により、200倍の高速化を実現

ある開発者が、AppleのMLXフレームワークを使用してローカルLLM推論のためのセッションベースKVキャッシュ再利用を実装し、10万トークンのコンテキスト長で初回トークンまでの時間を200倍改善しました。このアプローチでは、会話のターン間でKVキャッシュをメモリに保持し、新しいトークンのみを処理します。

OpenClawRadar
スレート:内蔵ブラウザ搭載のオープンソースmacOS AIチャットアプリ
Tools

スレート:内蔵ブラウザ搭載のオープンソースmacOS AIチャットアプリ

Slateは、AIチャットとウェブブラウジングを1つのウィンドウに統合したネイティブmacOSアプリです。Anthropic、OpenAI、Gemini、Ollamaのモデルをサポートしています。SwiftUIとWebKitで構築され、リソース消費が少なく、MITライセンスで提供されています。

OpenClawRadar