Локальные модели Qwen достигают автоматизации браузера с пошаговым планированием и компактным DOM.

Пошаговое планирование преодолевает неудачи предварительного планирования
Разработчик обнаружил, что просьба к моделям придумать полный многошаговый план до просмотра реального состояния страницы работает на знакомых сайтах, но быстро ломается при неожиданных элементах. Лучше сработало пошаговое планирование, при котором модель перепланирует на основе текущего снимка DOM на каждом шаге.
Пример процесса на Ace Hardware
Тестируемый процесс с Qwen 8B в качестве планировщика и 4B в качестве исполнителя на Ace Hardware (сайт, для которого у модели не было предыдущих задач) завершил полный процесс добавления в корзину без использования моделей компьютерного зрения. Пошаговый подход выглядел так:
- Шаг 1: увидеть поле поиска → ВВЕСТИ "газонокосилка"
- Шаг 2: увидеть результаты → НАЖАТЬ Добавить в корзину
- Шаг 3: появляется выдвижная панель → закрыть её
- Шаг 4: корзина видна → НАЖАТЬ Просмотреть корзину
- Шаг 5: ГОТОВО
Компактное представление DOM позволяет использовать небольшие модели
Модель никогда не видит исходный HTML или скриншоты — только семантическое табличное представление:
id|role|text|importance|bg|clickable|nearby_text
665|button|Proceed to checkout|675|orange|1|
761|button|Add to cart|720|yellow|1|$299.99
1488|link|ThinkPad E16|478|none|1|Laptop 16"
Это позволяет исполнителю 4B выбирать идентификатор элемента из короткого списка. Визуальные подходы тратят 2–3K токенов на скриншот, легко 50–100K+ для полного процесса, в то время как компактные снимки используют всего ~15K для той же задачи.
Обработка модальных окон критична для успеха
После каждого клика, если DOM внезапно увеличивается, агент сканирует шаблоны закрытия (close, ×, no thanks и т.д.) перед повторным планированием. Это исправило многие сбои, которые казались «плохим рассуждением», но на самом деле были скрытыми наложениями.
Разработчик отмечает, что ему интересно, замечают ли другие, что пошаговое планирование превосходит предварительное планирование, как только сайты становятся незнакомыми.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Дублёр: Обучаемый настольный агент, который осваивает задачи через демонстрацию
Understudy — это локально-ориентированная среда выполнения для настольных агентов, которая может управлять GUI-приложениями, браузерами, инструментами командной строки, файлами и обменом сообщениями в рамках одной сессии. Вы демонстрируете задачу один раз, система записывает видео с экрана и семантические события, извлекает намерение, а не координаты, и превращает это в повторно используемый навык.

Cognithor v0.40.0 добавляет постоянную идентичность ИИ-агента с этическими ограничениями.
Cognithor v0.40.0 представляет Протокол Бессмертного Разума, который обеспечивает локальным ИИ-агентам постоянную идентичность между сессиями с 7 встроенными этическими якорями и циклами сновидений для консолидации памяти. Обновление добавляет 9 488 строк кода и работает на 100% локально.

Многомодельный совет по рабочим процессам для ИИ-агентов программирования
Разработчик создал веб-инструмент, который выполняет задачи программирования через три модели ИИ — GPT-4o в роли архитектора, Claude в роли скептика и Gemini в роли синтезатора — перед передачей их агентам кодирования. Инструмент генерирует файл PLAN.md с явными ограничениями и требует от пользователей предоставления собственных API-ключей.

Панголи́н: VPN на основе открытого кода, основанный на идентификации, как альтернатива ZTNA
Панголин — это инструмент с открытым исходным кодом, ориентированный на удаленный доступ, основанный на идентичности, предлагающий альтернативу Cloudflare ZTNA, Zscaler и Twingate.