Lokale Qwen-Modelle erreichen Browser-Automatisierung mit schrittweiser Planung und kompakter DOM.

✍️ OpenClawRadar📅 Veröffentlicht: 17. März 2026🔗 Source
Lokale Qwen-Modelle erreichen Browser-Automatisierung mit schrittweiser Planung und kompakter DOM.
Ad

Schrittweise Planung überwindet Fehler bei vorabiger Planung

Der Entwickler stellte fest, dass das Anfordern von Modellen, einen vollständigen Mehrschrittplan zu erstellen, bevor der tatsächliche Seitenstatus sichtbar ist, auf bekannten Websites funktioniert, aber bei unerwarteten Elementen schnell versagt. Besser funktionierte die schrittweise Planung, bei der das Modell bei jedem Schritt basierend auf der aktuellen DOM-Momentaufnahme neu plant.

Beispielablauf auf Ace Hardware

Der getestete Ablauf mit Qwen 8B als Planer und 4B als Ausführer auf Ace Hardware (eine Website, für die das Modell keine vorherige Aufgabe hatte) schloss einen vollständigen Warenkorb-Ablauf ohne Verwendung eines Vision-Modells ab. Der schrittweise Ansatz sah so aus:

  • Schritt 1: Suchfeld sehen → TYP "Rasenmäher"
  • Schritt 2: Ergebnisse sehen → KLICK In den Warenkorb
  • Schritt 3: Schublade erscheint → schließen
  • Schritt 4: Warenkorb sichtbar → KLICK Warenkorb ansehen
  • Schritt 5: FERTIG
Ad

Kompakte DOM-Darstellung ermöglicht kleine Modelle

Das Modell sieht niemals rohes HTML oder Screenshots – nur eine semantische Tabellendarstellung:

id|role|text|importance|bg|clickable|nearby_text
665|button|Proceed to checkout|675|orange|1|
761|button|Add to cart|720|yellow|1|$299.99
1488|link|ThinkPad E16|478|none|1|Laptop 16"

Dies ermöglicht es dem 4B-Ausführer, eine Element-ID aus einer kurzen Liste auszuwählen. Vision-Ansätze verbrauchen 2-3K Token pro Screenshot, leicht 50-100K+ für einen vollständigen Ablauf, während kompakte Momentaufnahmen insgesamt ~15K für dieselbe Aufgabe verwenden.

Modale Handhabung entscheidend für Erfolg

Nach jedem Klick, wenn der DOM plötzlich wächst, sucht der Agent nach Schließmustern (schließen, ×, nein danke, usw.), bevor er erneut plant. Dies behebt viele Fehler, die wie "schlechte Schlussfolgerungen" erschienen, aber tatsächlich versteckte Overlays waren.

Der Entwickler merkt an, dass er neugierig ist, ob andere beobachten, dass schrittweise Planung vorabige Planung übertrifft, sobald Websites unbekannt werden.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

OpenClaw Agent Memory Plugin: Persistenter Kontext über Sitzungen hinweg
Werkzeuge

OpenClaw Agent Memory Plugin: Persistenter Kontext über Sitzungen hinweg

Ein Entwickler hat ein Memory-Layer-Plugin für OpenClaw erstellt, das vor jedem Zug relevanten Kontext aus vergangenen Gesprächen einspielt und nach jedem Zug neue Fakten und Ereignisse speichert, wodurch das Problem gelöst wird, dass Agenten zwischen Sitzungen alles vergessen.

OpenClawRadar
Claude Code Ultracode-Modus erzeugt 70-Agenten-Pipeline für Tiefensuche
Werkzeuge

Claude Code Ultracode-Modus erzeugt 70-Agenten-Pipeline für Tiefensuche

Eine einzelne 'Deep Search'-Anfrage im Ultracode-Modus von Claude Code erzeugte automatisch eine 4-Phasen-Pipeline mit ~70 Agents, die jeweils eigenständig Projekte abrufen und abgleichen. Das Orchestrierungsskript hält Zwischenergebnisse aus dem Kontextfenster fern und verhindert so eine Kontextüberlastung.

OpenClawRadar
Hubcap Bridge: Persistente bidirektionale Kommunikation zwischen CLI und Browser-JavaScript via CDP
Werkzeuge

Hubcap Bridge: Persistente bidirektionale Kommunikation zwischen CLI und Browser-JavaScript via CDP

Hubcap Bridge ist eine neue Funktion im Hubcap-CLI-Tool, die einen persistenten bidirektionalen Nachrichtenkanal zwischen lokalen Prozessen und in Browser-Seiten laufendem JavaScript über das Chrome DevTools Protocol erstellt. Es ermöglicht Claude Code-Fähigkeiten, über interne JavaScript-APIs mit Web-Apps zu interagieren, ohne Zugang zu öffentlichen APIs zu benötigen.

OpenClawRadar
Claudetop: Echtzeit-Kostenüberwachung für Claude-Code-Sitzungen
Werkzeuge

Claudetop: Echtzeit-Kostenüberwachung für Claude-Code-Sitzungen

Claudetop ist ein htop-ähnliches Tool, das Echtzeit-Ausgaben, Cache-Effizienz und Modellvergleiche für Claude Code-Sitzungen anzeigt. Es bietet Slash-Befehle wie /claudetop:stats und intelligente Warnungen für Kostenmeilensteine und Effizienzprobleme.

OpenClawRadar