Agente Web TinyFish Supera Concorrentes em Benchmarking de Tarefas na Web

✍️ OpenClawRadar📅 Publicado: February 13, 2026🔗 Source
Agente Web TinyFish Supera Concorrentes em Benchmarking de Tarefas na Web
Ad

O TinyFish Web Agent provou ser uma ferramenta líder no enfrentamento de tarefas web complexas, alcançando uma taxa de sucesso de 81,9% em tarefas difíceis no benchmark Online-Mind2Web, que consiste em 300 tarefas em 136 sites ativos. Este número contrasta fortemente com os principais concorrentes, como o OpenAI Operator, que conseguiu apenas uma taxa de sucesso de 43,2% em tarefas semelhantes.

O benchmark Online-Mind2Web é uma medida rigorosa das capacidades de um agente web, testando-o em tarefas que variam de fáceis, como navegar por ofertas de cartão de crédito no Marriott, a desafios complexos, como reservar ingressos para eventos com preços dinâmicos. As tarefas envolvem múltiplas etapas com sites ativos, incluindo o tratamento de validação de formulários e pop-ups, tornando-o um teste realista em comparação com outros benchmarks menos confiáveis, como o WebVoyager.

A TinyFish se destaca por lidar efetivamente com erros cumulativos. Ela perde apenas 15,6 pontos de tarefas fáceis para difíceis, em comparação com quedas massivas mostradas por outros sistemas, destacando sua robustez em cenários do mundo real. Notavelmente, ela publicou todas as 300 execuções de tarefas, incluindo seus 40 fracassos, o que oferece transparência sobre suas características de desempenho e casos de falha, como bloqueios anti-bot em nível de infraestrutura encontrados em sites como apartments.com.

Ad

Desenvolvedores que buscam uma ferramenta robusta de automação web acharão interessante o repositório de receitas de código aberto da TinyFish, que fornece insights sobre sua arquitetura e metodologia de execução.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Explorando Mistral Voxtral Realtime 4B em C Puro para Conversão de Fala em Texto
Tools

Explorando Mistral Voxtral Realtime 4B em C Puro para Conversão de Fala em Texto

O Voxtral.c oferece uma implementação em C puro para o modelo de conversão de fala em texto Voxtral Realtime 4B da Mistral AI, eliminando dependências além da biblioteca padrão C.

OpenClawRadar
iai-mcp: Um daemon local para memória persistente do OpenClaw entre sessões
Tools

iai-mcp: Um daemon local para memória persistente do OpenClaw entre sessões

iai-mcp é um daemon open-source que captura todas as conversas do OpenClaw, armazena-as em três camadas de memória com embeddings neurais locais e criptografia AES-256, e fornece contexto relevante de volta em novas sessões — recall literal >99%, recuperação <100ms, custo de início de sessão <3k tokens.

OpenClawRadar
Agente de Codificação Pi com Qwen 35B Q2: Usando Sistema de Arquivos como Memória Externa e Impondo Guardas de Contexto
Tools

Agente de Codificação Pi com Qwen 35B Q2: Usando Sistema de Arquivos como Memória Externa e Impondo Guardas de Contexto

Um usuário do Reddit construiu uma stack em torno do agente de codificação Pi com Qwen 35B Q2_K_XL quant que impõe guardiões — rejeita edições com mais de 100 linhas, limita blocos de pensamento a 2000 caracteres e monitora o contexto em 65%/80% — tratando o sistema de arquivos como a memória do modelo, não a janela de contexto.

OpenClawRadar
Usuário do OpenClaw Critica a Arquitetura e as Lacunas de Segurança da Ferramenta
Tools

Usuário do OpenClaw Critica a Arquitetura e as Lacunas de Segurança da Ferramenta

Um usuário do Reddit descreve o OpenClaw como a única ferramenta que torna a automação de agentes tão acessível, mas critica sua arquitetura por não ter uma camada de controle para operações de arquivos, um kernel protegido, gerenciamento de contexto adequado e versionamento ou testes integrados.

OpenClawRadar