C#とローカルLLMで自律型研究エージェントを構築する

これは、ローカルLLM、具体的にはOllamaとllama3.1:8bモデルを活用してC#で構築された新しい自律型研究エージェントの概要です。このエージェントは、検索クエリの生成、Brave Search APIを介したウェブ検索の実行、関連データの抽出といったURL処理プロセスを自動化し、最終的に構造化されたマークダウンレポートを作成します。
主な詳細
- エージェントは、例えば「AIエージェントのための永続メモリ」といったトピック入力を受け付けます。
- 自律的に5〜8個の検索クエリを生成します。
- Brave Search APIを介して検索を実行し、上位の情報源を取得して分析します。
- エージェントは8〜12の情報源を読み込み、5〜8個の主要な発見を抽出します。
- すべてのデータ処理は、OpenAI/Anthropic APIに依存せず、Ollama(llama3.1:8b)モデルを使用してローカルで実行されます。
- 出力は引用付きの完全なマークダウンレポートです。
性能とアーキテクチャ
現在のセットアップは、Ryzen 5 5500、CPUのみ、16GB RAMで動作し、1回の研究サイクルに約15分かかります。開発者は、llama3.2などの3Bモデルはツール呼び出しに不十分であり、信頼性のある性能には8Bが最低限必要であると指摘しています。
主な課題には、長いコンテキストでモデルが停止するのを防ぐために合成前に発見を切り詰める必要性、および8Bモデルでも時折発生する不正なツール呼び出し(プロンプトを変更して再試行することで解決)が含まれます。エージェントは、個人規模でのメモリ管理に埋め込みと組み合わせたSQLiteを利用し、ベクトルデータベースの必要性を排除しています。
技術スタック
- C# / .NET 8
- Ollama
- SQLite
- Brave Search API(無料ティア)
独自のエージェントを構築したい開発者向けに、プロジェクトのGitHubリポジトリには、MITライセンスで提供されるスターターキットと8章のガイド、および完全なソースコードがあります:hex-dynamics。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

Krasis: 大規模MoEモデルのためのハイブリッドCPU/GPUランタイム、RTX 5080で3,324 tok/sのプリフィルを達成
Krasisは、大規模なMoEモデルを実行するためのハイブリッドCPU/GPUランタイムで、GPUでプリフィルを処理し、CPUでデコードを行うことで、RTX 5080でQwen3-Coder-Next 80B Q4モデルに対して3,324トークン/秒のプリフィル速度を達成しています。VRAMに収まらないモデルを実行可能にする一方で、モデルサイズの約2.5倍のシステムRAMを必要とします。

GLM-5-Turbo、ユーザーテストで低いツール呼び出しエラー率を実証
z-ai/glm-5-turboモデルは、テストにおいて平均0.57%のツールコールエラー率を示し、GLM-5の約3%という率を大幅に下回っています。ユーザーは、CLIツールと組み合わせて使用し、最小限の問題で97,000語のファンタジー小説を書き上げることに成功したと報告しています。

Fennara: Godotプラグインと反復フィードバックループによるAIエージェント向けMCP
FennaraはGodotプラグインおよびMCPサーバーで、AIエージェントにスクリプト診断、シーン検証、ランタイムエラー、ノード情報、スクリーンショット、セマンティック検索結果を各編集後に提供し、ワンショットコマンドよりも密なフィードバックループを実現します。

レイヤーキット:Claude Codeで構築された編集可能なレイヤー搭載AI画像エディター
ある開発者がLayerkitを構築しました。これはブラウザベースのAI画像エディタで、編集可能なレイヤーを持つシーンを生成し、絶え間ない再プロンプトを避けることができます。このツールは多段階のAIパイプラインを使用しており、1つのLLMが構図を計画し、画像モデルがシーンを生成し、別のLLMが実際の画像を分析して読みやすいテキストを配置します。