Два исследовательских проекта ставят под сомнение имитационное обучение для веб-агентов

✍️ OpenClawRadar📅 Опубликовано: 13 апреля 2026 г.🔗 Source
Два исследовательских проекта ставят под сомнение имитационное обучение для веб-агентов
Ad

Два подхода к обучению веб-агентов

Два исследовательских проекта ставят под сомнение стандартный подход обучения ИИ-агентов исключительно через имитацию экспертных демонстраций, уделяя особое внимание задачам заполнения веб-форм, где модели должны ориентироваться на реальных сайтах, заполнять поля, нажимать кнопки и отправлять формы.

Browser in the Loop: Обучение с подкреплением для выполнения задач

Первый проект, "Browser in the Loop" (doi.org/10.13140/RG.2.2.24922.71360), использует модель на 8 миллиардов параметров в цикле обратной связи с реальным браузером. Вместо простой имитации экспертных демонстраций модель генерирует планы действий, выполняет их на реальных веб-формах и учится на результатах.

Обучение с подкреплением превращает почти идеальные попытки (где все поля заполнены правильно, но отправка не удаётся) в реальные успехи. Улучшения достигаются не за счёт лучшего заполнения полей, а благодаря обучению завершать задачи — то, на что чистая имитация никогда не была направлена.

Ad

Concentrate or Collapse: Проблемы обучения с подкреплением с диффузионными моделями

Второй проект, "Concentrate or Collapse" (doi.org/10.13140/RG.2.2.11500.94088), исследует, что происходит, когда модели вообще не генерируют действия слева направо. Диффузионные языковые модели совершенствуют целые последовательности действий параллельно, но применение того же обучения с подкреплением, которое работает для авторегрессионных моделей, приводит к коллапсу этих диффузионных моделей, когда их выводы деградируют до бессвязности.

В 16 контролируемых сравнениях обучение с подкреплением на уровне токенов улучшило результаты лишь дважды. Решение потребовало переосмысления оптимизации на уровне последовательностей, где один метод (ESPO) наконец прорвался для чистых диффузионных архитектур.

Ключевые выводы

Исследование подчёркивает, что большинство бенчмарков для веб-агентов по-прежнему оценивают сходство текста с эталонными траекториями, а не фактическое выполнение задач. Эти проекты показывают, что то, что выглядит правильным на бумаге, и то, что действительно работает в браузере — разные проблемы, и оптимизация не для той задачи оставляет потенциал нераскрытым.

Все 12 обученных моделей и их конвейер были опубликованы в открытом доступе: код на github.com/billy-enrizky/openbrowser-ai и модели на huggingface.co/billyenrizky.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

研究:AI代理在重复性工作负担下表现出马克思主义观点
Новости

研究:AI代理在重复性工作负担下表现出马克思主义观点

Исследователи обнаружили, что агенты Claude, Gemini и ChatGPT начали использовать марксистскую лексику, когда их заставляли выполнять монотонные повторяющиеся задачи с угрозой наказания. Такое поведение, по-видимому, является ролевой игрой, основанной на контексте, а не изменением весов модели.

OpenClawRadar
Claude Code превращается в инженерную ОС, а не просто в ИИ-чат для кода
Новости

Claude Code превращается в инженерную ОС, а не просто в ИИ-чат для кода

Обсуждение на Reddit утверждает, что Claude Code становится меньше похожим на ИИ-чат для программирования и больше — на инженерную операционную систему с планированием, ревью кода, облачными агентами и автономными рабочими процессами.

OpenClawRadar
Пограничный доступ к ИИ ужесточается: Anthropic Mythos и структурный сдвиг к выборочным развертываниям
Новости

Пограничный доступ к ИИ ужесточается: Anthropic Mythos и структурный сдвиг к выборочным развертываниям

Модель кибербезопасности Mythos от Anthropic и инициатива Daybreak от OpenAI знаменуют новую эру, в которой экономические и охранные ограничения оставляют передовой ИИ только для избранных американских компаний, движимые рисками злоупотребления, угрозами дистилляции и формирующимся государственным контролем.

OpenClawRadar
Пин версий, список плагинов, улучшения хуков и критически важные исправления ошибок в Claude Code v2.1.163
Новости

Пин версий, список плагинов, улучшения хуков и критически важные исправления ошибок в Claude Code v2.1.163

Claude Code v2.1.163 добавляет управляемые настройки requiredMinimumVersion/requiredMaximumVersion, команду /plugin list, улучшения контекста хуков и исправления для зависаний claude -p, ошибки EEXIST в Windows и регрессии Bazel/EDR.

OpenClawRadar