ТайниФиш Веб Агент превосходит конкурентов в бенчмаркинге веб-задач.

✍️ OpenClawRadar📅 Опубликовано: 13 февраля 2026 г.🔗 Source
ТайниФиш Веб Агент превосходит конкурентов в бенчмаркинге веб-задач.
Ad

Веб-агент TinyFish зарекомендовал себя как ведущий инструмент для решения сложных веб-задач, достигнув 81,9% успеха в сложных задачах на контрольном тесте Online-Mind2Web, который состоит из 300 заданий на 136 реальных веб-сайтах. Эта цифра резко контрастирует с основными конкурентами, такими как OpenAI Operator, который смог достичь лишь 43,2% успеха в аналогичных задачах.

Контрольный тест Online-Mind2Web является строгой мерой возможностей веб-агента, тестируя их на задачах, варьирующихся от простых, таких как поиск предложений по кредитным картам на Marriott, до сложных вызовов, таких как бронирование билетов на мероприятия с динамическим ценообразованием. Задачи включают в себя множество этапов на реальных веб-сайтах, включая обработку валидации форм и всплывающих окон, что делает его реалистичным тестом по сравнению с другими менее надежными контрольными тестами, такими как WebVoyager.

TinyFish выделяется своей способностью эффективно справляться с накопительными ошибками. Он теряет всего 15,6 пункта при переходе от простых к сложным задачам, в отличие от крупных падений, демонстрируемых другими системами, что подчеркивает его надежность в реальных сценариях. Примечательно, что он опубликовал все 300 запусков задач, включая 40 неудач, что предоставляет прозрачность в отношении его характеристик производительности и случаев неудач, например, блокировок на уровне инфраструктуры, с которыми сталкиваются такие сайты, как apartments.com.

Ad

Разработчики, ищущие надежный инструмент веб-автоматизации, найдут интересным открытый репозиторий кулинарной книги TinyFish, который дает представление о его архитектуре и методологии выполнения.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

Оркестратор рабочих процессов с интеграцией ИИ-интерфейса командной строки для задач системного администратора.
Инструменты

Оркестратор рабочих процессов с интеграцией ИИ-интерфейса командной строки для задач системного администратора.

Разработчик создал файловый оркестратор рабочих процессов под названием 'workflow', который интегрируется с Claude Code, Codex CLI и Gemini CLI. Он генерирует, обновляет, исправляет и улучшает YAML-воркфлоу из описаний на естественном языке для задач системного администратора.

OpenClawRadar
Приложение QCAI предоставляет мобильный центр управления для экосистемы OpenClaw.
Инструменты

Приложение QCAI предоставляет мобильный центр управления для экосистемы OpenClaw.

Академическая исследовательская команда выпустила приложение QCAI для iOS и Android, созданное с помощью ИИ-разработки, предлагающее мониторинг через панель управления, чат шлюза и безопасный VPN-доступ к инструментам OpenClaw.

OpenClawRadar
Мастерство Клода в Коде: Опенсорсная система конфигурации добавляет постоянную память и отобранные навыки в CLI Claude Code
Инструменты

Мастерство Клода в Коде: Опенсорсная система конфигурации добавляет постоянную память и отобранные навыки в CLI Claude Code

Claude Code Mastery — это система конфигурации с открытым исходным кодом, которая добавляет постоянную память между сеансами, интеллектуальные хуки жизненного цикла и более 26 тщательно отобранных навыков в CLI Claude Code. Она включает в себя 6-файловый Memory Bank для каждого проекта, запускатор с нулевой конфигурацией и кроссплатформенную поддержку.

OpenClawRadar
Состояние локальных инструментов глубокого исследования: GPT Researcher и Local Deep Research лидируют, проекты STORM и LangChain застопорились
Инструменты

Состояние локальных инструментов глубокого исследования: GPT Researcher и Local Deep Research лидируют, проекты STORM и LangChain застопорились

Опрос Reddit о локальных проектах глубоких исследований по состоянию на май 2026 года показывает, что GPT Researcher и Local Deep Research от LearningCircuit наиболее активны; STORM и Open Deep Research от LangChain заброшены или полузаброшены.

OpenClawRadar