二つの研究プロジェクトがウェブエージェントの模倣学習に挑戦

✍️ OpenClawRadar📅 公開日: April 13, 2026🔗 Source
二つの研究プロジェクトがウェブエージェントの模倣学習に挑戦
Ad

ウェブエージェントトレーニングの2つのアプローチ

2つの研究プロジェクトが、専門家のデモンストレーションの模倣のみを通じてAIエージェントをトレーニングする標準的なアプローチに挑戦しています。特に、モデルが実際のウェブサイトをナビゲートし、フィールドに入力し、ボタンをクリックし、フォームを送信する必要があるウェブフォーム入力タスクに焦点を当てています。

Browser in the Loop: タスク完了のための強化学習

最初のプロジェクト「Browser in the Loop」(doi.org/10.13140/RG.2.2.24922.71360)は、実際のブラウザとのフィードバックループで80億パラメーターモデルを使用します。専門家のデモンストレーションを模倣するだけではなく、モデルはアクションプランを生成し、ライブウェブフォームに対して実行し、結果から学習します。

強化学習により、ほぼ完璧な試み(すべてのフィールドが正しいが送信に失敗する場合)が実際の成功に変換されます。この向上は、フィールドの入力が改善されたからではなく、ゴールラインを越えることを学習したことによるものです。これは模倣だけでは最適化されなかったことです。

Concentrate or Collapse: 拡散モデルにおける強化学習の課題

2番目のプロジェクト「Concentrate or Collapse」(doi.org/10.13140/RG.2.2.11500.94088)は、モデルが左から右へとアクションを生成しない場合に何が起こるかを探ります。拡散言語モデルはアクションシーケンス全体を並列に洗練しますが、自己回帰モデルで機能する同じ強化学習を適用すると、これらの拡散モデルは崩壊し、出力が無意味なものに劣化します。

16の制御比較において、トークンレベルの強化学習が改善したのはわずか2回でした。修正には、シーケンスレベルでの最適化の再考が必要であり、ある方法(ESPO)が純粋な拡散アーキテクチャでついに突破口を開きました。

主な示唆

この研究は、ほとんどのウェブエージェントベンチマークが、実際のタスク完了ではなく、参照軌跡とのテキスト類似性で評価されていることを強調しています。これらのプロジェクトは、紙の上で正しく見えるものと、ブラウザで実際に機能するものは異なる問題であり、間違ったものを最適化すると性能を十分に引き出せないことを示唆しています。

トレーニングされた12のモデルすべてとそのパイプラインはオープンソース化されています:コードはgithub.com/billy-enrizky/openbrowser-ai、モデルはhuggingface.co/billyenrizkyで公開されています。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

GPUの電力消費は、小型LLMにおいてトークン予測理論から逸脱する
News

GPUの電力消費は、小型LLMにおいてトークン予測理論から逸脱する

4つの80億パラメータモデルを用いた『確率的オウム』理論の実験では、GPUの電力消費量がトークン数に対して非線形にスケールすることが多く、乖離率は7.7%から36.7%の範囲であることが判明しました。この研究では、哲学的なクエリの後に持続的な残留熱が生じることや、順序依存効果も明らかになりました。

OpenClawRadar
Kimi K2.6 対 Claude Opus 4.7:Minetest Mod + Google Sheets連携による実践的コーディング対決
News

Kimi K2.6 対 Claude Opus 4.7:Minetest Mod + Google Sheets連携による実践的コーディング対決

開発者がKimi K2.6とClaude Opus 4.7を、TypeScriptバックエンドとGoogle Sheetsログ機能を持つMinetestのバウンティボードMOD構築でテスト。Opusは両方のタスクを達成、Kimiはローカルタスクは合格したが統合タスクは失敗。コスト:Opus約$3.59(ローカル)、$16.03(統合);Kimi $0.39(ローカル)、$5.03(失敗)。

OpenClawRadar
ベンチマークによると、スマートフォンから家庭内チャットアプリケーションにおいて、小規模な4Bモデルが大規模LLMを上回る性能を示しています。
News

ベンチマークによると、スマートフォンから家庭内チャットアプリケーションにおいて、小規模な4Bモデルが大規模LLMを上回る性能を示しています。

電話から自宅チャットアプリケーション向けの8つのローカルLLMベンチマークでは、最小モデルであるGemma3:4Bが総合適合度スコア88.7で優勝しました。応答速度の速さと発熱負荷の低さにより、最大24Bパラメータの大規模モデルを上回る結果となりました。

OpenClawRadar
Claude-Code v2.1.108では、プロンプトキャッシュ制御、要約機能、スラッシュコマンド検出機能が追加されました。
News

Claude-Code v2.1.108では、プロンプトキャッシュ制御、要約機能、スラッシュコマンド検出機能が追加されました。

Claude-Code v2.1.108では、キャッシュTTL制御のためのENABLE_PROMPT_CACHING_1HとFORCE_PROMPT_CACHING_5M環境変数を導入し、/configまたは/recapで設定可能なセッション要約機能を追加し、モデルがSkillツールを通じて組み込みスラッシュコマンドを発見できるようにしました。

OpenClawRadar