永続的なローカルAIコンパニオンエージェント構築からの実践的教訓

✍️ OpenClawRadar📅 公開日: March 24, 2026🔗 Source
永続的なローカルAIコンパニオンエージェント構築からの実践的教訓
Ad

セットアップとアーキテクチャ

開発者がM4 Mac mini上でセルフホスト型AIエージェントを数ヶ月間運用している。このセットアップでは、高速なローカル推論のためにOllama上でqwen2.5:14bをRustランタイムで使用している。システムはモデルラダーを実装しており、タスクにより高い能力を必要とする場合にはクラウドモデルにエスカレートする。メモリはSQLiteで管理され、セッションをまたいだ意味的検索のためにnomic-embed-textを使用したローカル埋め込みが行われる。エージェントはlaunchd経由で24時間稼働し、トレーディングボットの監視、メールチェック、ウェブサイトのデプロイ、タスクランナーを介したClaude Codeへの重い実装作業の委任など、様々なタスクを実行する。

Ad

得られた主な教訓

メモリ・アーキテクチャが全てを決める: 開発者は、BM25キーワード検索とベクトル類似性を重み付けして統合するハイブリッド検索が画期的であることを発見した。優れたメモリ検索機能を持つ14Bモデルは、毎回の会話をゼロから始める70Bモデルよりも優れたパフォーマンスを発揮する。

システムプロンプトのコストは現実的: 初期のアイデンティティファイルは約10Kトークンから始まったが、エージェントが必要に応じて参照できるものは全て削減し、約2,800トークンまで縮小された。ルールは次の通り:エージェントが時々必要とするものはメモリに保存し、毎回のメッセージで必要とするものはシステムプロンプトに含める。

ローカル埋め込みが経済性を変えた: 会話モデルと並行してOllama上でnomic-embed-textを使用することで、すべてのメモリ保存と検索操作が無料になり、以前はOpenAIの埋め込みリクエストから蓄積されていたコストが解消された。

デフォルトモデルよりもモデルラダーが重要: エージェントは会話にはローカルのqwenをデフォルトで使用する(無料、高速)が、タスクの要件に応じてMinimax、Kimi、Haiku、Sonnet、Opusにエスカレートできる。重要な洞察:自動検出を試みるのではなく、推論タスクには/model sonnet、チャットには/model qwenといったコマンドで人間が手動でモデルを切り替えられるようにすること。

ツール反復回数の制限には余裕が必要: メッセージあたり最大10回のツール呼び出しから始めたが不十分だったことが判明。単純なタスクでは3〜5回のツール呼び出しを消費し、複雑なタスクでは15〜20回が必要となる。現在のセットアップでは、安全策として1時間あたり200アクションのレート制限とともに25回のツール呼び出しを使用している。

最も困難なバグはセッション間メモリだった: storeツールを介して明示的に保存されたメモリには当初session_idがなく、検索クエリは現在のsession_idでフィルタリングされていた。これにより、意図的に記憶された事実が将来のセッションで見えなくなっていた。修正方法は、SQLクエリにOR session_id IS NULLを追加することだった。

📖 元記事を読む: r/LocalLLaMA

Ad

👀 See Also

Claude Codeの効果的な使い方:フルSaaSアプリ構築における開発者の経験談
Use Cases

Claude Codeの効果的な使い方:フルSaaSアプリ構築における開発者の経験談

2021年からSaaS製品を開発してきた開発者が、Claude Codeを使用してcodefluent.appという完全なアプリケーションを構築しました。重要な洞察は、効果的なツールの使用には「アプリを作って」といった曖昧なプロンプトではなく、詳細な技術仕様が必要だということです。開発者は、明確な仕様を動作するコードに迅速に変換するためにClaude Codeを使用しながら、すべてのアーキテクチャ上の決定を自分で行うことを強調しています。

OpenClawRadar
Claude Projects + Gamma Connector: $12K MRR SaaS創業者による12分の投資家向けアップデート
Use Cases

Claude Projects + Gamma Connector: $12K MRR SaaS創業者による12分の投資家向けアップデート

インドの家庭教師向けSaaSを運営する創業者(MRR 12,000ドル)が、Claude Projects(永続的コンテキスト)とGammaコネクタを使って、投資家向けアップデートの作成時間を3時間から12分に短縮した方法。

OpenClawRadar
マルチエージェント設定が幻覚ループにより3,400ドルの請求を引き起こす
Use Cases

マルチエージェント設定が幻覚ループにより3,400ドルの請求を引き起こす

ある開発者が、マルチエージェントMCPセットアップのテスト中に、企業の仮想カードを環境変数にハードコードした結果、プライマリエージェントが幻覚ループに陥り、14時間にわたり45秒ごとに新しい有料プロキシインスタンスを起動し続け、3,400ドルの請求が発生しました。

OpenClawRadar
OpenClawエージェント構造:5つのコアファイルと3つの実用ケース
Use Cases

OpenClawエージェント構造:5つのコアファイルと3つの実用ケース

OpenClawのユーザーが、すべてのエージェントが5つのコアファイル(User、Soul、Agent、Tools、Identity)から構築されていることを発見しました。彼らは、日次AIブリーフィング集約ツール、子供向け数学コーチ、YouTubeショート動画生成ツールを含む3つの実用的なエージェントを共有しました。

OpenClawRadar