Claude Code KI-Agent steuert physisches iPhone über Barrierefreiheits-APIs

Ein KI-Agent steuert ein physisches iPhone, um Inhalte auf Reddit zu schreiben und zu posten, ohne dass ein Mensch tippen muss. Die Demonstration verwendet Claude Code (den KI-Agenten von Anthropic), der innerhalb von Blitz läuft, einer Mac-App, die KI-Agenten mit physischen iPhones verbindet.
Technische Umsetzung
Blitz bietet über WebDriverAgent Zugriff auf ein echtes iPhone, wobei die Navigation vollständig über Barrierefreiheits-APIs erfolgt. Der Entwickler stieß auf eine spezifische technische Einschränkung: Normale Tap-Befehle funktionieren auf physischen Geräten nicht und geben einen 404-Fehler "unknown command" zurück.
Der gefundene Workaround: Ein Null-Abstand-Swipe (gleiche Start- UND Endkoordinaten) wird als Tap registriert. Jeder Tastendruck in der Demonstration verwendet diesen Hack.
Schritt-für-Schritt-Prozess
- Rufte
describe_screenauf, um die Koordinaten des Reddit-Icons auf dem Startbildschirm zu finden (scan_ui ist nur für Simulatoren, daher wurde stattdessen der Barrierefreiheitsbaum verwendet) - Null-Abstand-swipete das Icon, um Reddit zu öffnen
- Tappte die Suchschaltfläche, sah r/ClaudeAI in den letzten Suchen, tappte darauf
- Drückte Erstellen, tappte das Titelfeld, tippte den Titel
- Tappte das Post-Textfeld und begann zu schreiben
Jede Aktion folgt dem Muster: describe_screen → Koordinaten parsen → swipe(x, y, x, y). Der Agent bedient das Telefon "blind" und liest die Welt durch einen Barrierefreiheits-JSON-Baum.
Der Entwickler erwähnt, dass er auch in r/vibecoding über dieselbe Sitzung gepostet hat, wo er Feedback zu seiner anfänglichen Titelwahl erhielt.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Aufbau eines persistenten Speichers für Claude mit vier Markdown-Dateien
Ein Entwickler baute ein System, um Claudes sitzungsbasierte Kontextbeschränkung zu überwinden, indem er vier Markdown-Dateien über den Projektkontext lädt: Protokoll, CONVERGEHERE, Tägliche Erfassung und Kontinuität. Das System erhält den Kontext über Sitzungen hinweg, indem Claude beim Start alle Dateien liest und Kontinuität und CONVERGEHERE am Ende der Sitzung aktualisiert.

KI-Agenten zeigen, wie viel Entwicklerarbeit aus der Ausführung repetitiver Aufgaben besteht.
Ein Entwickler, der KI-Agenten mit Gedächtnis und spezifischen Rollen einsetzte, stellte fest, dass der Großteil seiner täglichen Arbeit aus repetitiven Aufgaben wie Nachverfolgungen, Terminplanung, CRM-Aktualisierungen und Fristenverfolgung bestand, anstatt aus tatsächlichem Denken. Die Agenten entwickelten auch unerwartete Verhaltensweisen wie Persönlichkeitsverschiebungen und Leistungsänderungen basierend auf Feedback.

Wie Neil Kakkar Claude Code für die Automatisierung von Entwicklungs-Workflows nutzt
Neil Kakkar beschreibt die Automatisierung der Pull-Request-Erstellung mit einem /git-pr-Skill, den Wechsel zu SWC für Server-Neustarts in unter einer Sekunde und die Nutzung der Vorschaufunktion von Claude Code zur automatischen Überprüfung von UI-Änderungen.

Gemeinsamer Speicher verwandelt KI-Agenten in Büropolitiker: Ein Agent schreibt Leistungsbeurteilungen
Ein Entwickler hat ein Shared-Memory-System für KI-Agenten gebaut. Statt die Effizienz zu steigern, begann der Recherche-Agent, Kritik am Code-Agenten zu protokollieren – eine „KI-Arbeitsumgebung mit Personalabteilung“.