Les modèles Qwen locaux réalisent l'automatisation des navigateurs grâce à une planification étape par étape et un DOM compact.

La planification étape par étape surmonte les échecs de la planification prédéfinie
Le développeur a découvert que demander aux modèles d'inventer un plan multi-étapes complet avant de voir l'état réel de la page fonctionne sur des sites familiers mais échoue rapidement face à des éléments inattendus. Ce qui a mieux fonctionné était la planification étape par étape où le modèle replanifie à partir de l'instantané DOM actuel à chaque étape.
Exemple de flux sur Ace Hardware
Le flux testé avec Qwen 8B comme planificateur et 4B comme exécuteur sur Ace Hardware (un site pour lequel le modèle n'avait aucune tâche préalable) a complété un flux complet de panier sans aucune utilisation de modèle de vision. L'approche étape par étape ressemblait à ceci :
- Étape 1 : voir la boîte de recherche → TAPER "tondeuse à gazon"
- Étape 2 : voir les résultats → CLIQUER Ajouter au panier
- Étape 3 : un tiroir apparaît → le fermer
- Étape 4 : panier visible → CLIQUER Voir le panier
- Étape 5 : TERMINÉ
La représentation DOM compacte permet aux petits modèles
Le modèle ne voit jamais le HTML brut ni les captures d'écran—juste une représentation tabulaire sémantique :
id|role|text|importance|bg|clickable|nearby_text
665|button|Proceed to checkout|675|orange|1|
761|button|Add to cart|720|yellow|1|$299.99
1488|link|ThinkPad E16|478|none|1|Laptop 16"
Cela permet à l'exécuteur 4B de choisir un ID d'élément dans une courte liste. Les approches basées sur la vision consomment 2-3K tokens par capture d'écran, facilement 50-100K+ pour un flux complet, tandis que les instantanés compacts utilisent ~15K au total pour la même tâche.
La gestion des modales est cruciale pour le succès
Après chaque clic, si le DOM grossit soudainement, l'agent recherche des modèles de fermeture (fermer, ×, non merci, etc.) avant de replanifier. Cela a corrigé de nombreux échecs qui semblaient être de "mauvais raisonnements" mais étaient en réalité des superpositions cachées.
Le développeur note être curieux de savoir si d'autres observent que la planification étape par étape surpasse la planification prédéfinie une fois que les sites deviennent inconnus.
📖 Read the full source: r/LocalLLaMA
👀 See Also

mcp-india-stack : Serveur MCP open source pour les API financières indiennes
mcp-india-stack est un serveur MCP open-source qui fournit à Claude un accès natif à sept outils d'API financières et gouvernementales indiennes, incluant la validation GSTIN, la recherche IFSC et la validation PAN. Il ne nécessite aucune authentification, fonctionne en mode hors ligne par défaut et est disponible via pip install.

Machine Virtuelle Logique : Un Système Basé sur des Invites pour Stopper les Effondrements de Raisonnement des LLM
Un chercheur a développé un prompt de Machine Virtuelle Logique (LVM) qui force les LLM à s'arrêter et à signaler des modes d'effondrement spécifiques lorsqu'ils rencontrent des paradoxes ou des dérives de raisonnement, basé sur une seule loi de stabilité : K(σ) ⇒ K(β(σ)). Le prompt est indépendant du substrat et fonctionne sur des modèles comme Grok et Claude.

Architecture IA hybride locale-nuage : schémas pratiques inspirés par r/LocalLLaMA
Le post original propose un modèle d'IA hybride où un modèle local gère les tâches routinières et délègue les raisonnements complexes à un modèle cloud via un seul appel API, avec un « hyperviseur » déterministe pour les garde-fous.

Outil CLI Relay sauvegarde le contexte de session Claude lors des limitations de débit
Relay est un outil CLI en Rust qui lit les transcriptions de session .jsonl de Claude sur le disque et crée des instantanés complets de votre session, incluant la conversation, les appels d'outils, les tâches à faire, l'état git et les erreurs. Il génère des invites de contexte pour reprendre les sessions après la réinitialisation des limites de débit.