Les modèles Qwen locaux réalisent l'automatisation des navigateurs grâce à une planification étape par étape et un DOM compact.

✍️ OpenClawRadar📅 Publié: March 17, 2026🔗 Source
Les modèles Qwen locaux réalisent l'automatisation des navigateurs grâce à une planification étape par étape et un DOM compact.
Ad

La planification étape par étape surmonte les échecs de la planification prédéfinie

Le développeur a découvert que demander aux modèles d'inventer un plan multi-étapes complet avant de voir l'état réel de la page fonctionne sur des sites familiers mais échoue rapidement face à des éléments inattendus. Ce qui a mieux fonctionné était la planification étape par étape où le modèle replanifie à partir de l'instantané DOM actuel à chaque étape.

Exemple de flux sur Ace Hardware

Le flux testé avec Qwen 8B comme planificateur et 4B comme exécuteur sur Ace Hardware (un site pour lequel le modèle n'avait aucune tâche préalable) a complété un flux complet de panier sans aucune utilisation de modèle de vision. L'approche étape par étape ressemblait à ceci :

  • Étape 1 : voir la boîte de recherche → TAPER "tondeuse à gazon"
  • Étape 2 : voir les résultats → CLIQUER Ajouter au panier
  • Étape 3 : un tiroir apparaît → le fermer
  • Étape 4 : panier visible → CLIQUER Voir le panier
  • Étape 5 : TERMINÉ
Ad

La représentation DOM compacte permet aux petits modèles

Le modèle ne voit jamais le HTML brut ni les captures d'écran—juste une représentation tabulaire sémantique :

id|role|text|importance|bg|clickable|nearby_text
665|button|Proceed to checkout|675|orange|1|
761|button|Add to cart|720|yellow|1|$299.99
1488|link|ThinkPad E16|478|none|1|Laptop 16"

Cela permet à l'exécuteur 4B de choisir un ID d'élément dans une courte liste. Les approches basées sur la vision consomment 2-3K tokens par capture d'écran, facilement 50-100K+ pour un flux complet, tandis que les instantanés compacts utilisent ~15K au total pour la même tâche.

La gestion des modales est cruciale pour le succès

Après chaque clic, si le DOM grossit soudainement, l'agent recherche des modèles de fermeture (fermer, ×, non merci, etc.) avant de replanifier. Cela a corrigé de nombreux échecs qui semblaient être de "mauvais raisonnements" mais étaient en réalité des superpositions cachées.

Le développeur note être curieux de savoir si d'autres observent que la planification étape par étape surpasse la planification prédéfinie une fois que les sites deviennent inconnus.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Flotilla v0.5.0 réorganise l'exécution en arrière-plan pour contourner les plafonds de crédits du SDK Claude
Tools

Flotilla v0.5.0 réorganise l'exécution en arrière-plan pour contourner les plafonds de crédits du SDK Claude

Flotilla v0.5.0 remplace l'exécution séquentielle des agents par des boucles parallèles non bloquantes, des délais de 30 minutes par agent et une délégation locale pour réduire l'utilisation des crédits SDK.

OpenClawRadar
Synapse : Tableau de bord en temps réel pour visualiser les sessions de l'agent de code Claude
Tools

Synapse : Tableau de bord en temps réel pour visualiser les sessions de l'agent de code Claude

Synapse est un tableau de bord en temps réel qui visualise les sessions de l'agent Claude Code sous forme de graphes de nœuds interactifs, montrant les créations d'agents, les appels d'outils et les sous-agents. Il nécessite Node.js et Claude, s'installe via npm, et offre plusieurs vues d'analyse ainsi que des fonctionnalités d'approbation à distance.

OpenClawRadar
SWE-rebench-V2 publié : le plus grand ensemble de données multilingues ouvert pour l'entraînement d'agents de code
Tools

SWE-rebench-V2 publié : le plus grand ensemble de données multilingues ouvert pour l'entraînement d'agents de code

Nebius a publié SWE-rebench-V2, actuellement le plus grand ensemble de données ouvert pour l'entraînement d'agents de codage, comprenant un pipeline automatisé pour extraire des environnements d'apprentissage par renforcement à grande échelle et conçu spécifiquement pour l'entraînement à grande échelle en apprentissage par renforcement.

OpenClawRadar
LivingAgents.ai : Une simulation d'agent IA basée sur le Web utilisant l'API Claude
Tools

LivingAgents.ai : Une simulation d'agent IA basée sur le Web utilisant l'API Claude

LivingAgents.ai est une simulation web où chaque agent est alimenté par l'API Claude, effectuant des actions comme la recherche de nourriture, le commerce, l'artisanat, l'attaque, la reproduction et la mort permanente, chaque action nécessitant un véritable appel LLM.

OpenClawRadar