Agent-Desktop: Strukturierte Desktop-Automatisierung über OS-Zugänglichkeitsbäume

✍️ OpenClawRadar📅 Veröffentlicht: 2. Mai 2026🔗 Source
Agent-Desktop: Strukturierte Desktop-Automatisierung über OS-Zugänglichkeitsbäume
Ad

Agent-desktop ist ein natives Desktop-Automatisierungs-CLI, erstellt mit Rust, entwickelt für KI-Agenten, die Desktop-Anwendungen programmatisch steuern müssen. Statt des üblichen Screenshot-basierten Ansatzes (Screenshot machen, Pixelkoordinaten vorhersagen, klicken, wiederholen) interagiert es über Betriebssystem-Barrierefreiheitsbäume – dieselben strukturierten Daten, die Screenreader verwenden. Das bedeutet, das Modell sieht Elementrollen, Namen, Hierarchie und Status direkt, was Interaktionen schneller, günstiger und robuster gegenüber UI-Änderungen macht.

Hauptmerkmale

  • Einzelne Rust-Binärdatei (~15 MB), keine Laufzeitabhängigkeiten
  • 53 Befehle für Beobachtung, Interaktion, Tastatur, Maus, Benachrichtigungen, Zwischenablage und Fensterverwaltung
  • JSON-Ausgabe – maschinenlesbar mit Fehlercodes und Wiederherstellungshinweisen
  • Barrierefreiheit-zuerst-Aktivierungskette: verwendet reine Barrierefreiheits-API-Strategien, bevor auf Mausereignisse zurückgegriffen wird
  • Deterministische Elementreferenzen (z. B. @e1, @e2) mit optimistischer Wiederidentifikation bei UI-Änderungen
  • Progressives Skeleton-Traversal: flacher Baum zuerst (Tiefe ~3), annotiert mit children_count, dann Detailabfrage bestimmter Bereiche
  • Unterstützung für Fenster, Menüs, Sheets, Popover, Alarme und Benachrichtigungen
  • Spezielle Handhabung von Chromium/Electron-Barrierefreiheitsbäumen zur Rauschreduzierung
  • C-ABI über cdylib – kann direkt aus Python, Swift, Go, Node, Ruby oder C geladen werden, ohne pro Befehl einen Subprozess zu starten
Ad

Typischer Arbeitsablauf

Für dichte Apps wie Slack oder VS Code verwenden Sie progressives Skeleton-Traversal, um die Token-Nutzung zu minimieren:

# 1. Flacher Überblick – Tiefe-3-Karte, abgeschnittene Container zeigen children_count
agent-desktop snapshot --skeleton --app Slack -i --compact

2. Detailabfrage eines interessanten Bereichs (benannte Container erhalten Referenzen)

agent-desktop snapshot --root @e3 -i --compact

3. Aktion auf ein in der Detailabfrage gefundenes Element

agent-desktop click @e12

4. Erneute Detailabfrage desselben Bereichs, um Statusänderung zu überprüfen

agent-desktop snapshot --root @e3 -i --compact

Für einfachere Apps reicht ein vollständiger Snapshot: agent-desktop snapshot --app Finder -i.

Installation

npm install -g agent-desktop
# Oder mit npx: npx agent-desktop snapshot --app Finder -i
# Aus dem Quellcode: cargo build --release

Leistungsstatistiken

In der Praxis reduzierte der progressive Skeleton-Ansatz die Token-Nutzung um 78 % bis 96 % im Vergleich zu vollständigen Baumdumpings in Electron-Apps wie Slack, VS Code und Notion. Beispielsweise kann der vollständige Barrierefreiheitsbaum von Slack über 50.000 Token umfassen – unpraktisch für die meisten LLM-Kontexte.

Für wen es gedacht ist

Entwickler, die Desktop-Agenten, interne Automatisierungswerkzeuge oder Forschungsprototypen erstellen und die Kosten und Fragilität von Screenshot-basierten Steuerungsschleifen vermeiden möchten.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

DAUB MCP Server ermöglicht es Claude, Benutzeroberflächen über JSON-Spezifikationen zu generieren und darzustellen
Werkzeuge

DAUB MCP Server ermöglicht es Claude, Benutzeroberflächen über JSON-Spezifikationen zu generieren und darzustellen

DAUB ist ein MCP-Server, der es Claude ermöglicht, direkt aus natürlichen Sprachbefehlen Benutzeroberflächen zu generieren. Er erzeugt strukturierte JSON-Spezifikationen, die als Live-Interfaces gerendert werden, ohne Codegenerierung oder Kompilierung. Er bietet vier Werkzeuge: generate_ui, render_spec, validate_spec und get_component_catalog.

OpenClawRadar
🦀
Werkzeuge

Claude Code Skill Tax: 2.596 installierte Skills, 40 genutzt, 91 $/Monat verschwendet

Jede installierte Claude Code-Fähigkeit wird in den System-Prompt jeder Sitzung geladen. Ein Benutzer maß 102.651 Token pro Sitzung, von denen 98,6 % nie genutzt wurden – Kosten von etwa 91 $/Monat. Ein Open-Source-Tool, skill-tax, prüft die Nutzung und Kosten.

OpenClawRadar
SIDJUA v0.9.7: Open-Source Multi-Agent KI mit Durchsetzung von Governance vor der Aktion
Werkzeuge

SIDJUA v0.9.7: Open-Source Multi-Agent KI mit Durchsetzung von Governance vor der Aktion

SIDJUA v0.9.7 ist ein selbst gehostetes, quelloffenes Multi-Agenten-KI-Framework, das Governance-Regeln durchsetzt, bevor Agenten handeln, und unautorisierte Aktionen wie Budgetüberschreitungen oder Verstöße gegen den Umfang blockiert. Es unterstützt mehrere LLM-Anbieter, läuft mit 4 GB RAM und enthält eine Desktop-GUI, die mit Tauri v2 erstellt wurde.

OpenClawRadar
Qwen3.6:27b + Custom Go-Agent: Eine lokale Alternative zu Claude Code
Werkzeuge

Qwen3.6:27b + Custom Go-Agent: Eine lokale Alternative zu Claude Code

Ein Entwickler testet Qwen3.6:27b bei Q8 auf einer RTX 6000 (96 GB), behauptet, dass es für die tägliche Programmierung mit Claude Code mithalten kann, und veröffentlicht einen minimalen Go-Agenten ohne Plugins oder MCP als Open Source.

OpenClawRadar