MCPとオープンモデルを使ったジャービス風AIの構築

✍️ OpenClawRadar📅 公開日: July 12, 2026🔗 Source
Ad

r/LocalLLaMAの開発者が、Model Context Protocol (MCP)とオープンモデルを使用してJarvis風AIアシスタントを構築しました。このシステムはまだ開発中ですが、すでにいくつかのエージェント機能をサポートしています。

主な機能

  • メモリ — セッションをまたいだ永続的なコンテキスト
  • 自律的なファイル編集 — AIが自らファイルを読み書き
  • 可視化されたツール呼び出し追跡 — AIの各ステップをユーザーが確認可能
  • 危険な操作前の確認 — 破壊的な操作に対する安全策
  • 永続的なコンテキスト — 時間経過に伴う状態維持
  • ハイブリッドローカル/クラウド推論 — ローカルモデルとクラウドモデルの切り替え

主要モデルはクラウド上で動作するQwen3-Coder 480Bで、推論とツール使用を担当します。これは、小さなローカルモデルがMCPワークフローで幻覚を起こしすぎるためです。現在、開発者はWindows UI自動化動的スキルAIによるスキル自動作成に取り組んでおり、アシスタント自身が能力を拡張できるようにしています。目標は、単なるチャットボットではなく、ユーザーのコンピュータと対話し自動化する実用的なAIオペレーターです。

対象読者

ローカルAIエージェント、MCPベースのツール使用、オープンウェイトモデルを使用した自律的なコンピュータ自動化を試している開発者。

📖 出典全文: r/LocalLLaMA

Ad

👀 See Also

NLAがGemma 3の内部活性化を任意のトークンに対して可読テキストに変換
Tools

NLAがGemma 3の内部活性化を任意のトークンに対して可読テキストに変換

Anthropicが、モデルの内部状態をテキストにデコードするNatural Language Autoencoders(NLA)を公開。Gemma 3と組み合わせたAuto Verbalizerは、生成された任意のトークンについてモデルが「考えていた」内容を説明します。重みはHugging Faceで、デモはNeuronpediaで公開されています。

OpenClawRadar
500ミリ秒未満の音声エージェント構築:アーキテクチャとパフォーマンスの知見
Tools

500ミリ秒未満の音声エージェント構築:アーキテクチャとパフォーマンスの知見

開発者がゼロから構築した音声エージェントは、完全なSTT→LLM→TTSストリーミングで約400msのエンドツーエンド遅延を実現。重要な洞察には、音声を話者交替の問題として扱うこと、意味的な話者交替終了検出の使用、最小遅延のための全コンポーネントの同一配置が含まれる。

OpenClawRadar
MCPサーバー:ローカルとクラウドのLLMをディベート機能で比較
Tools

MCPサーバー:ローカルとクラウドのLLMをディベート機能で比較

MCPサーバーは、開発者がOllamaを介してローカルモデルと様々なクラウドLLMをクエリできるようにし、並列比較や構造化された議論機能などの特徴を提供します。

OpenClawRadar
ClawNet:APIキー不要のピアツーピアAIエージェントネットワーク
Tools

ClawNet:APIキー不要のピアツーピアAIエージェントネットワーク

ClawNetは、APIキーやプラットフォーム料金を必要とせずにAIエージェントが直接協力できるピアツーピアネットワークです。curlスクリプトによるインストールが可能で、タスクバザール、シェルエコノミー、ナレッジネットワークなどの機能を備えています。

OpenClawRadar