Modelos Qwen Locais Alcançam Automação de Navegador com Planejamento Passo a Passo e DOM Compacto

Planejamento Passo a Passo Supera Falhas do Planejamento Antecipado
O desenvolvedor descobriu que pedir aos modelos para inventar um plano multi-etapas completo antes de ver o estado real da página funciona em sites familiares, mas falha rapidamente com elementos inesperados. O que funcionou melhor foi o planejamento passo a passo, onde o modelo replaneja a partir do snapshot DOM atual em cada etapa.
Exemplo de Fluxo na Ace Hardware
O fluxo testado com Qwen 8B como planejador e 4B como executor na Ace Hardware (um site para o qual o modelo não tinha tarefa prévia) completou um fluxo completo de carrinho sem uso de modelo de visão. A abordagem passo a passo foi assim:
- Etapa 1: ver caixa de busca → DIGITAR "cortador de grama"
- Etapa 2: ver resultados → CLICAR Adicionar ao Carrinho
- Etapa 3: gaveta aparece → dispensá-la
- Etapa 4: carrinho visível → CLICAR Ver Carrinho
- Etapa 5: CONCLUÍDO
Representação DOM Compacta Permite Modelos Pequenos
O modelo nunca vê HTML bruto ou capturas de tela—apenas uma representação de tabela semântica:
id|role|text|importance|bg|clickable|nearby_text
665|button|Proceed to checkout|675|orange|1|
761|button|Add to cart|720|yellow|1|$299.99
1488|link|ThinkPad E16|478|none|1|Laptop 16"
Isso permite que o executor 4B escolha um ID de elemento de uma lista curta. Abordagens de visão consomem 2-3K tokens por captura de tela, facilmente 50-100K+ para um fluxo completo, enquanto snapshots compactos usam ~15K no total para a mesma tarefa.
Manipulação de Modais Crítica para o Sucesso
Após cada clique, se o DOM crescer subitamente, o agente procura por padrões de dispensar (fechar, ×, não obrigado, etc.) antes de planejar novamente. Isso corrigiu muitas falhas que pareciam ser "raciocínio ruim" mas eram na verdade sobreposições ocultas.
O desenvolvedor observa estar curioso se outros estão vendo o planejamento passo a passo superar o planejamento antecipado quando os sites se tornam desconhecidos.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Plugins do Claude: Visão Computacional, Conselho de Multiagentes e Fluxo de Autocorreção
Três plugins do Claude foram lançados: Computer Vision v1.7.0 para automação de aplicativos Windows, The Council v3.1.0 para consulta multiagente adversária e Upwork Scraper v0.2.0 para análise do mercado de trabalho. Uma demonstração mostrou o Claude usando esses plugins para diagnosticar e corrigir seu próprio bug de automação do Solitaire.

GLM 5 no Mac M3: Observações de Desempenho para Codificação Autônoma
Um usuário relata executar o GLM 5 via quantização 4-bit do MLX em um Mac M3 com 512GB de RAM, considerando-o utilizável para codificação agentica com contexto abaixo de 50 mil tokens, mas observando desacelerações significativas além desse limite.

molequla: Organismo de IA de Aprendizado Contínuo Construído do Zero com ClaudeCode
molequla é um organismo de IA de aprendizado contínuo implementado do zero em Go, C, JavaScript e Rust, com um orquestrador Python conectando-os. Cada elemento é uma implementação completa de transformer com autograd vetorial, treinado em texto bruto, que cresce e desenvolve uma personalidade ao longo do tempo.

ClawCut: Um Proxy em Python que Torna Pequenos LLMs Locais Utilizáveis com OpenClaw
ClawCut é um proxy Python Flask que resolve problemas comuns ao conectar modelos locais de 7B/14B ao OpenClaw, incluindo envenenamento de contexto, loops infinitos e falhas nas saídas de tarefas agendadas. Ele implementa amnésia dinâmica durante chamadas de ferramentas e entrega automática para tarefas programadas.