L'Agent Web TinyFish Surpasse les Concurrents dans les Tests de Performance de Tâches Web

L'agent web TinyFish s'est avéré être un outil de premier plan pour aborder des tâches web complexes, atteignant un taux de réussite de 81,9 % sur les tâches difficiles du benchmark Online-Mind2Web, qui comprend 300 tâches réparties sur 136 sites web en direct. Ce chiffre contraste fortement avec ceux des principaux concurrents, comme OpenAI Operator, qui n'a atteint qu'un taux de réussite de 43,2 % sur des tâches similaires.
Le benchmark Online-Mind2Web est une mesure rigoureuse des capacités d'un agent web, les testant sur des tâches allant de simples, comme parcourir les offres de cartes de crédit sur Marriott, à des défis complexes tels que la réservation de billets d'événements avec tarification dynamique. Les tâches impliquent plusieurs étapes sur des sites web en direct, y compris la gestion de la validation de formulaires et des fenêtres contextuelles, ce qui en fait un test réaliste par rapport à d'autres benchmarks moins fiables comme WebVoyager.
TinyFish se distingue en gérant efficacement les erreurs cumulatives. Il ne perd que 15,6 points entre les tâches faciles et difficiles, contrairement aux baisses massives observées avec d'autres systèmes, soulignant ainsi sa robustesse dans des scénarios réels. Notamment, il a publié l'ensemble des 300 exécutions de tâches, y compris ses 40 échecs, ce qui offre une transparence sur ses caractéristiques de performance et ses cas d'échec, tels que les blocages anti-bots au niveau de l'infrastructure rencontrés sur des sites comme apartments.com.
Les développeurs à la recherche d'un outil robuste d'automatisation web trouveront intéressant le dépôt de recettes open-source de TinyFish, qui donne un aperçu de son architecture et de sa méthodologie d'exécution.
📖 Lire la source complète : HN AI Agents
👀 See Also

LLM Circuit Finder : Dupliquez 3 couches pour renforcer le raisonnement sans entraînement
Un nouvel outil identifie des 'circuits de raisonnement' dans les modèles de transformateurs - des blocs contigus de 3-4 couches qui agissent comme des unités cognitives indivisibles. Dupliquer ces blocs (couches 12-14 dans Devstral-24B) améliore le raisonnement déductif de 0,22 à 0,76 sur les benchmarks BBH sans modification des poids ni entraînement.

moine : Une compétence qui réduit au silence la narration de l'agent pour économiser le contexte et les jetons
Un utilisateur de Reddit a publié 'monk', une compétence qui supprime les narrations, préambules et postambules des réponses de l'agent Claude, revendiquant une réduction d'environ 54% des tokens de sortie par tour et un gain de 29-39% de capacité de contexte sur 100 tours.

Deux mois avec Spec-Kit de GitHub et Claude Code : ce qui fonctionne, ce qui ne fonctionne pas
Un développeur partage des notes pratiques sur l'utilisation de la boîte à outils Spec-Driven Development de GitHub avec Claude Code, couvrant le flux de travail en cinq phases, les problèmes de dérive, les compromis de surcharge et les conseils de configuration.

Ouroboros ajoute un mode d'entretien PM pour Claude Code afin de combler l'écart de spécifications
Ouroboros inclut désormais un mode PM qui exécute un entretien guidé avant de passer le relais à Claude Code, posant des questions telles que : quel problème est résolu, pour qui, et quelles contraintes sont importantes. Le résultat est un document PRD/PM avec objectif, histoires utilisateur, contraintes, critères de réussite, hypothèses et éléments reportés.