Agent-Desktop: Strukturierte Desktop-Automatisierung über OS-Zugänglichkeitsbäume

Agent-desktop ist ein natives Desktop-Automatisierungs-CLI, erstellt mit Rust, entwickelt für KI-Agenten, die Desktop-Anwendungen programmatisch steuern müssen. Statt des üblichen Screenshot-basierten Ansatzes (Screenshot machen, Pixelkoordinaten vorhersagen, klicken, wiederholen) interagiert es über Betriebssystem-Barrierefreiheitsbäume – dieselben strukturierten Daten, die Screenreader verwenden. Das bedeutet, das Modell sieht Elementrollen, Namen, Hierarchie und Status direkt, was Interaktionen schneller, günstiger und robuster gegenüber UI-Änderungen macht.
Hauptmerkmale
- Einzelne Rust-Binärdatei (~15 MB), keine Laufzeitabhängigkeiten
- 53 Befehle für Beobachtung, Interaktion, Tastatur, Maus, Benachrichtigungen, Zwischenablage und Fensterverwaltung
- JSON-Ausgabe – maschinenlesbar mit Fehlercodes und Wiederherstellungshinweisen
- Barrierefreiheit-zuerst-Aktivierungskette: verwendet reine Barrierefreiheits-API-Strategien, bevor auf Mausereignisse zurückgegriffen wird
- Deterministische Elementreferenzen (z. B.
@e1,@e2) mit optimistischer Wiederidentifikation bei UI-Änderungen - Progressives Skeleton-Traversal: flacher Baum zuerst (Tiefe ~3), annotiert mit
children_count, dann Detailabfrage bestimmter Bereiche - Unterstützung für Fenster, Menüs, Sheets, Popover, Alarme und Benachrichtigungen
- Spezielle Handhabung von Chromium/Electron-Barrierefreiheitsbäumen zur Rauschreduzierung
- C-ABI über cdylib – kann direkt aus Python, Swift, Go, Node, Ruby oder C geladen werden, ohne pro Befehl einen Subprozess zu starten
Typischer Arbeitsablauf
Für dichte Apps wie Slack oder VS Code verwenden Sie progressives Skeleton-Traversal, um die Token-Nutzung zu minimieren:
# 1. Flacher Überblick – Tiefe-3-Karte, abgeschnittene Container zeigen children_count
agent-desktop snapshot --skeleton --app Slack -i --compact
2. Detailabfrage eines interessanten Bereichs (benannte Container erhalten Referenzen)
agent-desktop snapshot --root @e3 -i --compact
3. Aktion auf ein in der Detailabfrage gefundenes Element
agent-desktop click @e12
4. Erneute Detailabfrage desselben Bereichs, um Statusänderung zu überprüfen
agent-desktop snapshot --root @e3 -i --compact
Für einfachere Apps reicht ein vollständiger Snapshot: agent-desktop snapshot --app Finder -i.
Installation
npm install -g agent-desktop
# Oder mit npx: npx agent-desktop snapshot --app Finder -i
# Aus dem Quellcode: cargo build --release
Leistungsstatistiken
In der Praxis reduzierte der progressive Skeleton-Ansatz die Token-Nutzung um 78 % bis 96 % im Vergleich zu vollständigen Baumdumpings in Electron-Apps wie Slack, VS Code und Notion. Beispielsweise kann der vollständige Barrierefreiheitsbaum von Slack über 50.000 Token umfassen – unpraktisch für die meisten LLM-Kontexte.
Für wen es gedacht ist
Entwickler, die Desktop-Agenten, interne Automatisierungswerkzeuge oder Forschungsprototypen erstellen und die Kosten und Fragilität von Screenshot-basierten Steuerungsschleifen vermeiden möchten.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

DAUB MCP Server ermöglicht es Claude, Benutzeroberflächen über JSON-Spezifikationen zu generieren und darzustellen
DAUB ist ein MCP-Server, der es Claude ermöglicht, direkt aus natürlichen Sprachbefehlen Benutzeroberflächen zu generieren. Er erzeugt strukturierte JSON-Spezifikationen, die als Live-Interfaces gerendert werden, ohne Codegenerierung oder Kompilierung. Er bietet vier Werkzeuge: generate_ui, render_spec, validate_spec und get_component_catalog.
Claude Code Skill Tax: 2.596 installierte Skills, 40 genutzt, 91 $/Monat verschwendet
Jede installierte Claude Code-Fähigkeit wird in den System-Prompt jeder Sitzung geladen. Ein Benutzer maß 102.651 Token pro Sitzung, von denen 98,6 % nie genutzt wurden – Kosten von etwa 91 $/Monat. Ein Open-Source-Tool, skill-tax, prüft die Nutzung und Kosten.

SIDJUA v0.9.7: Open-Source Multi-Agent KI mit Durchsetzung von Governance vor der Aktion
SIDJUA v0.9.7 ist ein selbst gehostetes, quelloffenes Multi-Agenten-KI-Framework, das Governance-Regeln durchsetzt, bevor Agenten handeln, und unautorisierte Aktionen wie Budgetüberschreitungen oder Verstöße gegen den Umfang blockiert. Es unterstützt mehrere LLM-Anbieter, läuft mit 4 GB RAM und enthält eine Desktop-GUI, die mit Tauri v2 erstellt wurde.

Qwen3.6:27b + Custom Go-Agent: Eine lokale Alternative zu Claude Code
Ein Entwickler testet Qwen3.6:27b bei Q8 auf einer RTX 6000 (96 GB), behauptet, dass es für die tägliche Programmierung mit Claude Code mithalten kann, und veröffentlicht einen minimalen Go-Agenten ohne Plugins oder MCP als Open Source.