ТайниФиш Веб Агент превосходит конкурентов в бенчмаркинге веб-задач.

Веб-агент TinyFish зарекомендовал себя как ведущий инструмент для решения сложных веб-задач, достигнув 81,9% успеха в сложных задачах на контрольном тесте Online-Mind2Web, который состоит из 300 заданий на 136 реальных веб-сайтах. Эта цифра резко контрастирует с основными конкурентами, такими как OpenAI Operator, который смог достичь лишь 43,2% успеха в аналогичных задачах.
Контрольный тест Online-Mind2Web является строгой мерой возможностей веб-агента, тестируя их на задачах, варьирующихся от простых, таких как поиск предложений по кредитным картам на Marriott, до сложных вызовов, таких как бронирование билетов на мероприятия с динамическим ценообразованием. Задачи включают в себя множество этапов на реальных веб-сайтах, включая обработку валидации форм и всплывающих окон, что делает его реалистичным тестом по сравнению с другими менее надежными контрольными тестами, такими как WebVoyager.
TinyFish выделяется своей способностью эффективно справляться с накопительными ошибками. Он теряет всего 15,6 пункта при переходе от простых к сложным задачам, в отличие от крупных падений, демонстрируемых другими системами, что подчеркивает его надежность в реальных сценариях. Примечательно, что он опубликовал все 300 запусков задач, включая 40 неудач, что предоставляет прозрачность в отношении его характеристик производительности и случаев неудач, например, блокировок на уровне инфраструктуры, с которыми сталкиваются такие сайты, как apartments.com.
Разработчики, ищущие надежный инструмент веб-автоматизации, найдут интересным открытый репозиторий кулинарной книги TinyFish, который дает представление о его архитектуре и методологии выполнения.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Оркестратор рабочих процессов с интеграцией ИИ-интерфейса командной строки для задач системного администратора.
Разработчик создал файловый оркестратор рабочих процессов под названием 'workflow', который интегрируется с Claude Code, Codex CLI и Gemini CLI. Он генерирует, обновляет, исправляет и улучшает YAML-воркфлоу из описаний на естественном языке для задач системного администратора.

Приложение QCAI предоставляет мобильный центр управления для экосистемы OpenClaw.
Академическая исследовательская команда выпустила приложение QCAI для iOS и Android, созданное с помощью ИИ-разработки, предлагающее мониторинг через панель управления, чат шлюза и безопасный VPN-доступ к инструментам OpenClaw.

Мастерство Клода в Коде: Опенсорсная система конфигурации добавляет постоянную память и отобранные навыки в CLI Claude Code
Claude Code Mastery — это система конфигурации с открытым исходным кодом, которая добавляет постоянную память между сеансами, интеллектуальные хуки жизненного цикла и более 26 тщательно отобранных навыков в CLI Claude Code. Она включает в себя 6-файловый Memory Bank для каждого проекта, запускатор с нулевой конфигурацией и кроссплатформенную поддержку.

Состояние локальных инструментов глубокого исследования: GPT Researcher и Local Deep Research лидируют, проекты STORM и LangChain застопорились
Опрос Reddit о локальных проектах глубоких исследований по состоянию на май 2026 года показывает, что GPT Researcher и Local Deep Research от LearningCircuit наиболее активны; STORM и Open Deep Research от LangChain заброшены или полузаброшены.