Lokale Qwen-Modelle erreichen Browser-Automatisierung mit schrittweiser Planung und kompakter DOM.

Schrittweise Planung überwindet Fehler bei vorabiger Planung
Der Entwickler stellte fest, dass das Anfordern von Modellen, einen vollständigen Mehrschrittplan zu erstellen, bevor der tatsächliche Seitenstatus sichtbar ist, auf bekannten Websites funktioniert, aber bei unerwarteten Elementen schnell versagt. Besser funktionierte die schrittweise Planung, bei der das Modell bei jedem Schritt basierend auf der aktuellen DOM-Momentaufnahme neu plant.
Beispielablauf auf Ace Hardware
Der getestete Ablauf mit Qwen 8B als Planer und 4B als Ausführer auf Ace Hardware (eine Website, für die das Modell keine vorherige Aufgabe hatte) schloss einen vollständigen Warenkorb-Ablauf ohne Verwendung eines Vision-Modells ab. Der schrittweise Ansatz sah so aus:
- Schritt 1: Suchfeld sehen → TYP "Rasenmäher"
- Schritt 2: Ergebnisse sehen → KLICK In den Warenkorb
- Schritt 3: Schublade erscheint → schließen
- Schritt 4: Warenkorb sichtbar → KLICK Warenkorb ansehen
- Schritt 5: FERTIG
Kompakte DOM-Darstellung ermöglicht kleine Modelle
Das Modell sieht niemals rohes HTML oder Screenshots – nur eine semantische Tabellendarstellung:
id|role|text|importance|bg|clickable|nearby_text
665|button|Proceed to checkout|675|orange|1|
761|button|Add to cart|720|yellow|1|$299.99
1488|link|ThinkPad E16|478|none|1|Laptop 16"
Dies ermöglicht es dem 4B-Ausführer, eine Element-ID aus einer kurzen Liste auszuwählen. Vision-Ansätze verbrauchen 2-3K Token pro Screenshot, leicht 50-100K+ für einen vollständigen Ablauf, während kompakte Momentaufnahmen insgesamt ~15K für dieselbe Aufgabe verwenden.
Modale Handhabung entscheidend für Erfolg
Nach jedem Klick, wenn der DOM plötzlich wächst, sucht der Agent nach Schließmustern (schließen, ×, nein danke, usw.), bevor er erneut plant. Dies behebt viele Fehler, die wie "schlechte Schlussfolgerungen" erschienen, aber tatsächlich versteckte Overlays waren.
Der Entwickler merkt an, dass er neugierig ist, ob andere beobachten, dass schrittweise Planung vorabige Planung übertrifft, sobald Websites unbekannt werden.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Rails-AI-Context Gem stellt Claude-Code über MCP das vollständige Rails-App-Modell zur Verfügung
Das rails-ai-context gem introspectiert automatisch Rails-Anwendungen und stellt 39 Werkzeuge über MCP bereit, sodass Claude Code spezifische App-Details wie das Schema mit verschlüsselten Spalten, Modellbeziehungen, Routen, Stimulus-Verknüpfungen und Turbo-Zuordnungen abfragen kann, anstatt ganze Dateien zu lesen.

Aufbau eines Sprachassistenten mit unter 500 ms Latenz: Architektur und Leistungseinblicke
Ein Entwickler hat einen Sprachagenten von Grund auf neu gebaut und dabei eine End-to-End-Latenz von ~400 ms mit vollständigem STT → LLM → TTS-Streaming erreicht. Wichtige Erkenntnisse umfassen die Behandlung von Sprache als Problem der Sprechwechsel, die Verwendung semantischer Sprechwechselerkennung und die gemeinsame Platzierung aller Komponenten für minimale Latenz.

Claude Codes dateibasiertes Speichersystem: Eine pragmatische Alternative zu Vektor-Datenbanken
Claude Code implementiert ein dateibasiertes Speichersystem, das .md-Dateien mit Frontmatter-Metadaten und einer MEMORY.md-Indexdatei verwendet. Es vermeidet Vektordatenbanken und Embedding-Pipelines, indem es Dateien scannt, Manifeste erstellt und ein kleines Modell zur Auswahl relevanter Erinnerungen nutzt.

Chromeflow: Chrome-Erweiterung automatisiert Web-UI-Aufgaben für Claude
Chromeflow ist eine kostenlose, quelloffene Chrome-Erweiterung und MCP-Server, die mit Claude Code erstellt wurde und Claude Browsersteuerung gibt, um manuelle Web-UI-Aufgaben wie die Einrichtung von Stripe, Supabase oder SendGrid zu automatisieren. Es hebt Elemente zum Klicken hervor, füllt Felder aus, klickt auf Speichern und schreibt API-Schlüssel direkt in .env-Dateien.