小型本地模型运行编码代理时会出现什么问题

✍️ OpenClawRadar📅 公開日: April 30, 2026🔗 Source
小型本地模型运行编码代理时会出现什么问题
Ad

数週間にわたり、無料枠の小規模ローカルモデル(7B未満)と小規模クラウドモデルで実際のマルチファイルコーディングタスクを実行した結果、あるRedditユーザーが典型的なベンチマークノイズを超えた一貫した障害ポイントを記録しました。以下が実際に壊れる箇所です。

マークダウンフェンスが最も一般的な障害

システムプロンプトに「生のコードのみ出力、マークダウン書式なし」と指定しても、ほとんどのモデルは応答をトリプルバッククォートで囲みます。Qwen3.5:9bとGemma4:e4bは最も一貫して指示に従いますが、それでも時々問題が発生します。解決策はプロンプトの改善ではなく、デフォルトで後処理にてフェンスを除去することです。

7B未満では構造化出力は信頼できない

エージェントがタスクリストやアクションタイプにJSONを必要とする場合、小規模モデルはベンチマークが示すよりもはるかに頻繁に失敗します。ベンチマークは有効なJSONをテストしますが、実際の使用では複雑なマルチステップ指示とエッジケースが加わります。Gemma4:e4bはローカルモデルの中で最も信頼性が高く、Qwen3.5:9Bがそれに続きます。Codellamaは苦戦します。クラウドでは、Groq上のLlama 3.3 70Bは非常に安定しています。実用的な回避策:JSONを検証し、明示的な指示で一度再試行し、それでもダメなら散文からJSONを抽出する寛容なパーサーにフォールバックします。

モデルが間違ったファイルを編集する

小規模モデルに、類似名のプロジェクトマップを与えてvalidateTokenをverifyTokenにリネームするタスクを与えると、validateUserをリネームしたり、まったく間違ったファイルを変更したりする可能性があります。モデルはプロジェクトマップを提案ではなくヒントとして扱います。オーケストレーションレイヤーでの修正:ファイルパスが存在し、関数名が主張されたファイルにあることを検証します。不一致があればエラーをスローします——小規模モデルは自信満々に嘘をつきます。

Ad

質問 vs. アクションの分類

「utils.jsには何行ありますか?」という質問は読み取り専用であるべきです。しかし、実行部に編集モードしかない場合、答えを含めるためにファイルを編集してしまいます。修正策:プランナーは実行前にリクエストをアクションタイプに分類する必要があります。読み取り専用クエリは、ディスクに触れない別のコードパスにルーティングされます。

期待以上にうまくいくもの

  • コード内でのトークン予算強制:毎回の呼び出し前にトークンをカウントします。小規模モデルはコンテキスト制限の概念がなく、信頼されると簡潔になりません。
  • ファイルごとの分離:一度に1ファイルずつ送信すると、2ファイル送信よりも格段に信頼性が高くなります——モデルが修正を混同するのを防ぎます。
  • 合成スタイルのメモリ:モデルが行ったことの一文の要約を保存し、完全なタスクリストは保存しません。元に戻しや追加リクエストに有効です。

まだ模索中

7B未満のローカルモデルがエージェントの役割に適しているかどうか——著者は構造化出力に十分な頻度で失敗しないモデルをまだ見つけていません。オープンソースのテストハーネスはgithub.com/razvannecにあり、コントリビューションを歓迎します。

📖 全文ソースを読む: r/LocalLLaMA

Ad

👀 See Also

アイドルエージェントが1日5000万トークンを消費した理由と改善方法
Guides

アイドルエージェントが1日5000万トークンを消費した理由と改善方法

アイドル状態のOpenClawエージェントが、ハートビートpingにより毎日5000万トークンを無駄に消費。Redditユーザーがリークを追跡し、設定変更で修正した方法を共有。

OpenClawRadar
ネモクロー Windows セットアップの問題と解決策
Guides

ネモクロー Windows セットアップの問題と解決策

WindowsでのNemoClawインストールは、3つの特定のエラーで失敗します:Git Bashでのサポートされていない環境、ポート18789が既に使用中、OpenClawインストール時のDockerビルド失敗です。根本的な原因は、NemoClawがWindowsを考慮して構築されていないためであり、成功するセットアップにはWSL2 Ubuntuが必要です。

OpenClawRadar
AMD Ryzen AI Max+クラスターで1兆パラメータのLLMをローカル実行
Guides

AMD Ryzen AI Max+クラスターで1兆パラメータのLLMをローカル実行

AMDは、4台のFramework DesktopシステムとRyzen AI Max+ 395プロセッサを使用して、llama.cpp RPCでKimi K2.5オープンソースモデル(375GB、1兆パラメータ)を実行する方法を実証しました。このガイドでは、ノードあたり120GBのVRAMを確保するためのTTMカーネル修正と、Lemonade SDKの事前ビルド済みバイナリまたは手動でのROCm 7.0.2インストールの2つのセットアップオプションを提供しています。

OpenClawRadar
OpenClaw Project Operating System:マルチプロジェクト管理フレームワーク
Guides

OpenClaw Project Operating System:マルチプロジェクト管理フレームワーク

プロジェクトを標準化されたディレクトリで分離し、予測可能なタスクにはエージェントではなくcronを使用して自動化し、必須のバックアッププロトコルを実装することで、トークン使用量を削減し実行の一貫性を向上させるフレームワーク。

OpenClawRadar