L'Agent Web TinyFish Surpasse les Concurrents dans les Tests de Performance de Tâches Web

✍️ OpenClawRadar📅 Publié: February 13, 2026🔗 Source
L'Agent Web TinyFish Surpasse les Concurrents dans les Tests de Performance de Tâches Web
Ad

L'agent web TinyFish s'est avéré être un outil de premier plan pour aborder des tâches web complexes, atteignant un taux de réussite de 81,9 % sur les tâches difficiles du benchmark Online-Mind2Web, qui comprend 300 tâches réparties sur 136 sites web en direct. Ce chiffre contraste fortement avec ceux des principaux concurrents, comme OpenAI Operator, qui n'a atteint qu'un taux de réussite de 43,2 % sur des tâches similaires.

Le benchmark Online-Mind2Web est une mesure rigoureuse des capacités d'un agent web, les testant sur des tâches allant de simples, comme parcourir les offres de cartes de crédit sur Marriott, à des défis complexes tels que la réservation de billets d'événements avec tarification dynamique. Les tâches impliquent plusieurs étapes sur des sites web en direct, y compris la gestion de la validation de formulaires et des fenêtres contextuelles, ce qui en fait un test réaliste par rapport à d'autres benchmarks moins fiables comme WebVoyager.

Ad

TinyFish se distingue en gérant efficacement les erreurs cumulatives. Il ne perd que 15,6 points entre les tâches faciles et difficiles, contrairement aux baisses massives observées avec d'autres systèmes, soulignant ainsi sa robustesse dans des scénarios réels. Notamment, il a publié l'ensemble des 300 exécutions de tâches, y compris ses 40 échecs, ce qui offre une transparence sur ses caractéristiques de performance et ses cas d'échec, tels que les blocages anti-bots au niveau de l'infrastructure rencontrés sur des sites comme apartments.com.

Les développeurs à la recherche d'un outil robuste d'automatisation web trouveront intéressant le dépôt de recettes open-source de TinyFish, qui donne un aperçu de son architecture et de sa méthodologie d'exécution.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Orion : Contourner CoreML pour exécuter et entraîner des LLM directement sur le Neural Engine d'Apple
Tools

Orion : Contourner CoreML pour exécuter et entraîner des LLM directement sur le Neural Engine d'Apple

Orion est un système open-source en Objective-C qui contourne CoreML d'Apple pour exécuter et entraîner des LLM directement sur le moteur neuronal Apple (ANE), atteignant plus de 170 tokens/s pour le décodage GPT-2 124M et un entraînement stable multi-étapes sur un transformateur de 110 millions de paramètres.

OpenClawRadar
Constrails : Couche de gouvernance externe en phase alpha précoce pour les agents IA
Tools

Constrails : Couche de gouvernance externe en phase alpha précoce pour les agents IA

Constrails est une couche externe de gouvernance d'exécution pour les agents d'IA qui place une couche de contrôle entre les agents et leurs outils, mettant en œuvre des vérifications de capacités, une évaluation des risques, une évaluation des politiques et une journalisation d'audit. Le projet en phase alpha précoce vise à répondre aux préoccupations de sécurité en déplaçant les contrôles en dehors de l'agent lui-même.

OpenClawRadar
WebClaw : Serveur MCP Open-Source pour l'Extraction Web avec Claude
Tools

WebClaw : Serveur MCP Open-Source pour l'Extraction Web avec Claude

WebClaw est un serveur MCP open-source construit avec Claude Code qui fournit des outils d'extraction web pour Claude Desktop et Claude Code, résolvant les limitations du web_fetch intégré de Claude grâce à l'empreinte TLS et l'optimisation du contenu.

OpenClawRadar
Compétence de balayage de sécurité pour les agents d'IA de codage vérifiant automatiquement les déploiements
Tools

Compétence de balayage de sécurité pour les agents d'IA de codage vérifiant automatiquement les déploiements

Un développeur a créé un fichier de compétence qui permet aux agents d'IA de codage d'analyser automatiquement leurs propres déploiements pour détecter des problèmes de sécurité comme des secrets exposés, des ports ouverts, des en-têtes de sécurité manquants et du code source divulgué. L'analyse s'exécute après chaque déploiement et prend environ 30 secondes.

OpenClawRadar