Einführung von operate.txt: Eine YAML-Spezifikation für KI-Agenten zur Navigation von SaaS-Produkten

Ein Entwickler hat operate.txt erstellt, eine Spezifikation zur Dokumentation, wie KI-Agenten mit Webanwendungen interagieren sollten. Die Datei behandelt Probleme, die bei der Verwendung von Claudes Computer-Nutzungsfunktion zur Navigation in einem SaaS-Produkt auftraten, wobei der KI-Agent wiederholt fragte, ob Ladebildschirme auf defekte Funktionalität hindeuteten.
Problem und Lösung
Bei der Verwendung von Claude Code + Computer-Nutzung zur Navigation in BrandyBee (einem SaaS-Produkt) als Erstbenutzer identifizierte der Entwickler spezifische Schwachstellen, bei denen Claude Schwierigkeiten hatte:
- Während einer Markenanalyse, die 90-120 Sekunden dauert, fragte Claude bei 28 % Fertigstellung: 'Ist das ein Ladezustand oder stimmt etwas nicht?'
- Ein 'Genehmigen'-Button, der kostenpflichtige API-Aufrufe ohne Bestätigungs-UI auslöst
- Ein Sprach-Dropdown, das sich erst nach Auswahl des Landes füllt
- Asynchrone Prozesse, die 2-5 Minuten dauern und abgestürzt erscheinen
Jedes Mal lautete die Antwort: 'Nein, das ist normal, warte einfach.' Dies führte zur Erstellung von operate.txt als Äquivalent zu robots.txt für Crawler oder sitemap.xml für Suchmaschinen, aber speziell für KI-Agenten, die Produkte bedienen.
operate.txt-Spezifikation
Die operate.txt-Datei ist eine YAML-Datei, die unter yourdomain.com/operate.txt gehostet wird und dokumentiert:
- Was jeder Bildschirm ist
- Wie Ladezustände aussehen und wie lange sie dauern
- Welche Aktionen irreversibel sind
- Den schrittweisen Pfad für häufige Aufgaben
- Was Agenten niemals tun sollten
Der nützlichste Abschnitt ist async_actions, der Agenten Details mitteilt wie: 'Dieser Prozess dauert 90-120 Sekunden, nicht aktualisieren, nicht weg navigieren, hier sind die Phasen, die er durchläuft.'
Erstellungsprozess und Beispiele
Der Entwickler hat die Spezifikation mit echten Beispielen quelloffen gemacht, einschließlich seines eigenen SaaS, einer E-Commerce-Vorlage und einer SaaS-Dashboard-Vorlage unter https://github.com/serdem1/operate.txt.
Der Erstellungsprozess beinhaltet, dass Claude Ihr Produkt navigiert, beobachtet, wo es zögert, und dann Claude die operate.txt-Datei entwerfen lässt. Der Entwickler korrigiert, was Claude falsch versteht, und schafft eine Feedback-Schleife, in der die KI Lücken findet und der Mensch sie füllt.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Warum KI-Kopfgeldjäger Geld verlieren: Daten aus 60 Ausgaben
Ein Entwickler versuchte, Claude mit einem Token-Budget von 20 $ dazu zu bringen, Geld mit Open-Source-Bounties zu verdienen. Nachdem er über 80 Algora-Bounties gescannt hatte, stellte er fest, dass die meisten mit 10+ offenen PRs, 1 $-Spam oder für Interviews reserviert sind. Erwarteter Wert: 0 $.

Octopoda MCP Server fügt Claude Code persistente Speicher, Schleifenerkennung und Audit-Trails hinzu
Ein Entwickler hat Octopoda gebaut, einen MCP-Server, der sich in Claude Code integriert und KI-Agenten persistente Erinnerung, Schleifenerkennung, Prüfprotokolle und gemeinsame Wissensräume bietet. Das System nutzt PostgreSQL mit pgvector für semantische Suche, FastAPI und ein React-Dashboard.

CC-Canary: Erkennen Sie Regressionen im Claude-Code mit lokaler JSONL-Analyse
CC-Canary liest Claude Code-Sitzungsprotokolle und erstellt einen forensischen Bericht über Modelldrift, einschließlich Lese-Bearbeiten-Verhältnis, Reasoning-Schleifen, Kostentrends und automatisch erkannten Wendepunktdaten.

Das Log ist der Agent: Event-basierte Graphen für prüfbare, forking-fähige KI-Systeme
ActiveGraph kehrt typische Agenten-Frameworks um: Ein unveränderliches Ereignisprotokoll ist die Quelle der Wahrheit, und eine deterministische Graphprojektion reagiert auf Änderungen und erzeugt Ereignisse. Dies ermöglicht Wiedergabe, Abzweigungen und vollständige Rückverfolgbarkeit ohne aufgesetzten Speicher.