Modelos Qwen Locales Logran Automatización de Navegadores con Planificación Paso a Paso y DOM Compacto

La Planificación Paso a Paso Supera los Fallos de la Planificación Previa
El desarrollador descubrió que pedir a los modelos que inventen un plan completo de múltiples pasos antes de ver el estado real de la página funciona en sitios familiares, pero falla rápidamente con elementos inesperados. Lo que funcionó mejor fue la planificación paso a paso, donde el modelo replanifica desde la instantánea actual del DOM en cada paso.
Flujo de Ejemplo en Ace Hardware
El flujo probado con Qwen 8B como planificador y 4B como ejecutor en Ace Hardware (un sitio para el que el modelo no tenía tareas previas) completó un flujo completo del carrito sin usar ningún modelo de visión. El enfoque paso a paso se veía así:
- Paso 1: ver cuadro de búsqueda → ESCRIBIR "cortadora de césped"
- Paso 2: ver resultados → HACER CLIC en Añadir al Carrito
- Paso 3: aparece el cajón → descartarlo
- Paso 4: carrito visible → HACER CLIC en Ver Carrito
- Paso 5: HECHO
La Representación Compacta del DOM Permite Modelos Pequeños
El modelo nunca ve HTML crudo ni capturas de pantalla, solo una representación semántica en tabla:
id|role|text|importance|bg|clickable|nearby_text
665|button|Proceed to checkout|675|orange|1|
761|button|Add to cart|720|yellow|1|$299.99
1488|link|ThinkPad E16|478|none|1|Laptop 16"
Esto permite que el ejecutor de 4B elija un ID de elemento de una lista corta. Los enfoques de visión consumen 2-3K tokens por captura de pantalla, fácilmente 50-100K+ para un flujo completo, mientras que las instantáneas compactas usan ~15K en total para la misma tarea.
El Manejo de Modales es Crítico para el Éxito
Después de cada clic, si el DOM crece repentinamente, el agente escanea patrones de descarte (cerrar, ×, no gracias, etc.) antes de planificar nuevamente. Esto solucionó muchos fallos que parecían ser "mal razonamiento" pero en realidad eran superposiciones ocultas.
El desarrollador señala tener curiosidad por saber si otros están viendo que la planificación paso a paso supera a la planificación previa una vez que los sitios se vuelven desconocidos.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Causa Raíz de la Corrupción del Título de Sesión en la Extensión Claude Code de VS Code Identificada
Un desarrollador ha identificado la causa raíz arquitectónica de la corrupción de títulos de sesión en la extensión de VS Code Claude Code, afectando a más de 20 problemas en GitHub. El problema surge de que la extensión lee los títulos mediante una búsqueda de cadena de texto sin procesar en los archivos de sesión, lo que genera tres modos de fallo.

Construyendo un Agente de Voz de Menos de 500ms: Arquitectura y Perspectivas de Rendimiento
Un desarrollador construyó un agente de voz desde cero logrando una latencia de extremo a extremo de ~400ms con transmisión completa STT → LLM → TTS. Las ideas clave incluyen tratar la voz como un problema de toma de turnos, usar detección semántica de fin de turno y colocar todos los componentes para una latencia mínima.

Nexus Desktop App automatiza la configuración de MCP para la gestión de campañas de TTRPG
¿Cansado de editar manualmente la configuración de Claude Desktop para cada MCP? Nexus instala y configura Archivist, Foundry VTT, Notion, Obsidian y NotebookLM para la gestión de campañas de TTRPG.

pxpipe: Reduzca el uso de tokens de Claude Code en un 60 % representando el contexto como imágenes
pxpipe es un proxy local que convierte contexto voluminoso (prompts del sistema, documentación de herramientas, historial) en PNG compactos, reduciendo tokens de entrada ~10x y costos ~60% en cargas de trabajo densas en tokens.