LumaBrowser: Electron-Browser lagert DOM-Parsing auf lokale LLMs für KI-Agenten aus

✍️ OpenClawRadar📅 Veröffentlicht: 16. April 2026🔗 Source
LumaBrowser: Electron-Browser lagert DOM-Parsing auf lokale LLMs für KI-Agenten aus
Ad

Was LumaBrowser macht

LumaBrowser ist ein auf Electron basierender Browser, der speziell für autonome KI-Agenten entwickelt wurde, die mit Webseiten interagieren müssen. Das Kernproblem, das er löst: Agenten mussten zuvor Megabytes an rohem HTML verarbeiten, nur um einfache UI-Elemente wie Login-Buttons zu finden, was wertvollen Kontextfensterplatz und Rechenressourcen verschwendete.

Wie es funktioniert

Der Browser verbindet sich mit jedem OpenAI-kompatiblen Endpunkt (der Ersteller verwendet LM Studio), um das DOM-Parsing zu handhaben. Wenn ein Agent mit einem Seitenelement interagieren muss, analysiert das lokale Modell die DOM-Struktur, identifiziert das Zielelement (wie "den Login-Button") und gibt den entsprechenden CSS-Selektor zurück. Dadurch bleiben die Hauptagentenmodelle auf ihre eigentlichen Aufgaben fokussiert, anstatt HTML zu parsen.

Ad

Technische Umsetzung

  • Architektur: Electron-Browser mit MCP-Server über stdio und REST-API
  • Modellintegration: Funktioniert mit jedem OpenAI-kompatiblen Endpunkt
  • Verwendetes Modell: Der Ersteller berichtet von der Verwendung von Qwen 2.5-Varianten, speziell 35B-A3B über LM Studio
  • Teilmechanismus: Wenn ein LLM erfolgreich einen Selektor auflöst, teilt es eine anonymisierte Zuordnung mit einer öffentlichen Datenbank, um die Fallback-Leistung im Laufe der Zeit zu verbessern
  • Experimentelle Funktion: WebGPU-Modus zum direkten Ausführen kleiner Modelle im Browser (der Ersteller merkt an, dass die Ergebnisse bisher "unterschiedlich erfolgreich sind")

Anwendungsfall des Erstellers

Der Entwickler betreibt autonome Agenten auf einem 5090/3090-Setup, die geplante Aufgaben ausführen. Der Browserzugriff war zuvor der schwächste Punkt, weil Agenten gesamte HTML-Dokumente verarbeiten mussten, nur um einfache Elemente zu finden. Mit LumaBrowser wird das DOM-Parsing an spezialisierte Modelle ausgelagert, während die Hauptagenten sich auf die höhere Aufgabentlogik konzentrieren.

Verfügbarkeit

Das Tool ist kostenlos nutzbar. Der Erstler sucht aktiv nach Feedback dazu, welche Modelle am besten für DOM/UI-Elementidentifikationsaufgaben geeignet sind.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

PicoClaw scheitert am Bau eines F1-KI-Agents und verbrennt 20 US-Dollar an API-Guthaben.
Werkzeuge

PicoClaw scheitert am Bau eines F1-KI-Agents und verbrennt 20 US-Dollar an API-Guthaben.

Ein Entwickler versuchte, einen F1-Informationsbot mit PicoClaw auf einem Raspberry Pi Zero 2W zu erstellen, doch das Tool nutzte standardmäßig Version 11, erzeugte halluzinierte Python-Codes und verbrauchte 20 US-Dollar an DeepSeek-API-Guthaben, ohne eine funktionierende Lösung zu liefern.

OpenClawRadar
Agents Room: Desktop-App zur Visualisierung von Claude-Code-Agent-Teams
Werkzeuge

Agents Room: Desktop-App zur Visualisierung von Claude-Code-Agent-Teams

Agents Room ist eine Electron-Desktop-Anwendung, die nach .claude/agents/-Ordnern sucht, Frontmatter liest und Agentenbeziehungen auf einer Leinwand mit automatischen Verbindungslinien visualisiert. Sie ermöglicht das Erstellen/Bearbeiten von Agenten, Fähigkeiten und Befehlen direkt in der Benutzeroberfläche, anstatt Markdown-Dateien zu bearbeiten.

OpenClawRadar
LLMock: HTTP-basierter Mocking-Server für deterministische LLM-Tests über Prozesse hinweg
Werkzeuge

LLMock: HTTP-basierter Mocking-Server für deterministische LLM-Tests über Prozesse hinweg

LLMock ist ein echter HTTP-Server, der OpenAI-, Claude- und Gemini-APIs simuliert und Entwicklern ermöglicht, deterministische Tests über mehrere Prozesse hinweg auszuführen, ohne echte APIs anzusprechen. Er unterstützt SSE-Streaming, Tool-Aufrufe, Prädikat-Routing und Request-Protokollierung ohne Abhängigkeiten.

OpenClawRadar
Claude Code als Compiler: Eine praktische Neuausrichtung für die KI-Entwicklung
Werkzeuge

Claude Code als Compiler: Eine praktische Neuausrichtung für die KI-Entwicklung

Ein Reddit-Beitrag argumentiert, dass Claude Code wie ein Compiler funktioniert, der Englisch in funktionierende Software übersetzt, und zieht Parallelen zu historischen Durchbrüchen in der Informatik wie Grace Hoppers A-0 und FORTRAN. Der Autor beschreibt, wie aus einer 3-Absätze-langen englischen Beschreibung 400 Zeilen Code über 6 Dateien generiert wurden, wobei in 25 Minuten zwei Probleme entdeckt wurden.

OpenClawRadar