Browser-Harness: LLMs direkten CDP-Zugriff gewähren, um Browseraufgaben eigenständig zu korrigieren

✍️ OpenClawRadar📅 Veröffentlicht: 24. April 2026🔗 Source
Browser-Harness: LLMs direkten CDP-Zugriff gewähren, um Browseraufgaben eigenständig zu korrigieren
Ad

Browser Harness ist ein selbstheilendes Werkzeug, das LLMs vollständige Freiheit bei der Erledigung von Browseraufgaben gibt, indem es direkt über einen CDP-Websocket (~592 Zeilen Python) mit Chrome verbunden wird. Anstatt Chrome in vordefinierte Funktionen zu verpacken (wie Playwright MCP oder agent-browser), bietet es einen schlanken Daemon, der den Websocket, grundlegende Helfer und eine SKILL.md-Datei bereithält – und dem Agenten erlaubt, bei Bedarf eigene Tools zu schreiben.

So funktioniert es

Die Kernkonzepte sind:

  • Ein Daemon, der den CDP-Websocket am Leben hält
  • Sehr einfache Tools in helpers.py (~195 Zeilen)
  • Eine SKILL.md, die die Nutzung erklärt

Wenn das LLM eine Funktion benötigt, die nicht existiert, bearbeitet es helpers.py und fügt sie hinzu. Die Autoren berichten von einem Fall, in dem der Agent eine Datei hochladen wollte, keine upload_file()-Funktion fand, sie selbst mit DOM.setFileInputFiles schrieb und fortfuhr – nur in einem Git-Diff sichtbar.

Ad

Im Vergleich zu anderen Ansätzen

Andere Tools (Playwright MCP, browser-use CLI, agent-browser, Chrome DevTools MCP) hüllen Chrome in vordefinierte Funktionen. Ihr schlimmster Fehlermodus ist still: click() gibt Erfolg zurück, aber nichts ist passiert. Browser Harness zielt darauf ab, dem LLM perfekten Kontext und die Freiheit zur Selbstkorrektur zu geben.

Einrichtung und Installation

Installieren Sie es mit Claude Code oder Codex, indem Sie Folgendes einfügen:

Richten Sie https://github.com/browser-use/browser-harness für mich ein.

Der Agent liest install.md für den Start, dann SKILL.md für den normalen Gebrauch und prüft immer helpers.py auf verfügbare Funktionen.

Beispiele aus der Praxis

  • Spielt die Stockfish-Schachengine
  • Stellt einen Weltrekord in Tetris auf
  • Zeichnet ein Herz mit JavaScript

Mitwirken

Beiträge sind willkommen: Fügen Sie Domänenfähigkeiten unter domain-skills/ für Websites wie LinkedIn, Amazon usw. hinzu. Fähigkeiten werden vom Harness generiert, nicht von Hand erstellt. Fehlerbehebungen, Dokumentation und Verbesserungen der Helfer werden ebenfalls akzeptiert.

Lizenz: MIT.

📖 Vollständige Quelle lesen: HN LLM Tools

Ad

👀 Siehe auch

Open-Source-Framework nutzt Claude Code CLI zur automatisierten Überwachung von GitHub-Repositories
Werkzeuge

Open-Source-Framework nutzt Claude Code CLI zur automatisierten Überwachung von GitHub-Repositories

Ein Entwickler hat ein Framework quelloffen gemacht, das Claude Code CLI nach einem Cron-Zeitplan ausführt, um GitHub-Aktivitäten über mehrere Repositories hinweg zu sichten. Das Tool umfasst Zustandsverfolgung, Deduplizierung, Discord-Benachrichtigungen und ein Vorabprüfsystem, das API-Kosten vermeidet, wenn sich nichts geändert hat.

OpenClawRadar
Open Source SQLite-basiertes Persistent Memory System für Claude
Werkzeuge

Open Source SQLite-basiertes Persistent Memory System für Claude

Ein Entwickler hat memchat veröffentlicht, ein GPL-lizenziertes lokales System, das Wissen aus Claude-Sitzungen an Checkpoints extrahiert, in SQLite speichert und für neue Sitzungen wieder zusammensetzt, um den Kontext über Gespräche hinweg aufrechtzuerhalten.

OpenClawRadar
OpenClaw Video Translator Skill auf ClawHub verfügbar
Werkzeuge

OpenClaw Video Translator Skill auf ClawHub verfügbar

Eine neue Video-Übersetzer-Fähigkeit für OpenClaw-Agenten ermöglicht es Nutzern, ein Video hochzuladen oder eine URL anzugeben, um sofort eine übersetzte Vorschau zu erhalten. Die Fähigkeit wird auf ClawHub gehostet.

OpenClawRadar
Solo-Entwickler nutzt Claude + Blender MCP, um App-Store-Video in 90 Minuten zu erstellen
Werkzeuge

Solo-Entwickler nutzt Claude + Blender MCP, um App-Store-Video in 90 Minuten zu erstellen

Reddit-Benutzer Positive_Camel2086 beschreibt detailliert, wie sie Claude mit dem Blender MCP-Server verwendet haben, um ein 10-sekündiges vertikales Startvideo zu generieren, wobei Kamerarigging, Materialien, Nebel und Partikelsysteme durch konversationelle Eingabeaufforderungen automatisiert wurden.

OpenClawRadar