Agente Web TinyFish Supera Concorrentes em Benchmarking de Tarefas na Web

O TinyFish Web Agent provou ser uma ferramenta líder no enfrentamento de tarefas web complexas, alcançando uma taxa de sucesso de 81,9% em tarefas difíceis no benchmark Online-Mind2Web, que consiste em 300 tarefas em 136 sites ativos. Este número contrasta fortemente com os principais concorrentes, como o OpenAI Operator, que conseguiu apenas uma taxa de sucesso de 43,2% em tarefas semelhantes.
O benchmark Online-Mind2Web é uma medida rigorosa das capacidades de um agente web, testando-o em tarefas que variam de fáceis, como navegar por ofertas de cartão de crédito no Marriott, a desafios complexos, como reservar ingressos para eventos com preços dinâmicos. As tarefas envolvem múltiplas etapas com sites ativos, incluindo o tratamento de validação de formulários e pop-ups, tornando-o um teste realista em comparação com outros benchmarks menos confiáveis, como o WebVoyager.
A TinyFish se destaca por lidar efetivamente com erros cumulativos. Ela perde apenas 15,6 pontos de tarefas fáceis para difíceis, em comparação com quedas massivas mostradas por outros sistemas, destacando sua robustez em cenários do mundo real. Notavelmente, ela publicou todas as 300 execuções de tarefas, incluindo seus 40 fracassos, o que oferece transparência sobre suas características de desempenho e casos de falha, como bloqueios anti-bot em nível de infraestrutura encontrados em sites como apartments.com.
Desenvolvedores que buscam uma ferramenta robusta de automação web acharão interessante o repositório de receitas de código aberto da TinyFish, que fornece insights sobre sua arquitetura e metodologia de execução.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Protocolo de Navegador para Agentes: Fork de código aberto do Chrome para agentes de IA atinge 90% no benchmark Mind2Web
O Protocolo de Navegador de Agente (ABP) é um fork de código aberto do Chrome que congela o JavaScript e o tempo após cada ação para converter a navegação na web em chat multimodal para agentes de IA. Ele alcançou 90,53% no Online Mind2Web Benchmark e pode ser adicionado ao Claude Code com um único comando.

XLI: Biblioteca Python de Código Aberto para UIs de Terminal no Estilo Claude Code
Construindo um agente de código? Metade do trabalho é a UX do terminal. XLI é um mecanismo de renderização Python de código aberto que replica o streaming de markdown, cartões de ferramentas, aprovações inline e comandos de barra do Claude Code, sem sequestrar o histórico do terminal.

Habilidade de autocura de código aberto para agentes de IA detecta e corrige falhas automaticamente.
Uma nova habilidade de código aberto permite que agentes de IA detectem automaticamente falhas, diagnostiquem causas raiz e implementem correções. Inclui um scanner de falhas para crons, subagentes e logs de implantação, além de um banco de dados que aprende com correções anteriores.

Ferramenta de código aberto para feeds do Reddit curados por IA usando Cloudflare, Supabase e Vercel
Um desenvolvedor disponibilizou como código aberto uma ferramenta auto-hospedada que filtra o Reddit em busca de postagens de qualidade sobre desenvolvimento assistido por IA, usando Cloudflare Workers para tarefas agendadas e proxies, Supabase para armazenamento e Vercel para o frontend. A ferramenta inclui pontuação de engajamento, resumos opcionais de LLM e custa US$ 1-2/mês para processamento de IA.