Mehr-Agenten-Sicherheitsüberprüfung läuft täglich in der Produktion: Architektur und Erkenntnisse

Architekturdetails
Der Sicherheitsagent läuft täglich über einen Cron-Job via launchd. Er erhält einen Diff der letzten Commits sowie vollen Zugriff auf die Codebasis. Er prüft anhand einer strukturierten Schwachstellen-Checkliste, die Folgendes umfasst:
- IDOR
- Authentifizierungsumgehungen
- Injektionsvektoren
- Exponierte Geheimnisse
- Zu freizügige Routen
Der Agent erfasst die Ergebnisse als P0/P1/P2-Aufgaben in der Arbeitswarteschlange. Ein separater Programmieragent nimmt sie auf, behebt sie, committet die Änderungen und führt sie aus.
Koordinationsherausforderungen und Lösungen
Nach 3 Wochen Produktivbetrieb war die interessanteste Koordinationsherausforderung der Konflikt zwischen Sicherheits- und Programmieragent. Sicherheit markiert etwas, Programmierung behebt es, führt aber im nächsten Commit ein Muster ein, das Sicherheit noch nicht überprüft hat.
Die umgesetzte Lösung: Nur tägliche Durchläufe (nicht pro Commit) plus ein "reviewed_through"-Marker, damit Ergebnisse Commit-Kontext haben.
Leistungsbeobachtungen
Claude fiel als ungewöhnlich gut darin auf, zwischen "das sieht angreifbar aus" und "das ist in diesem Kontext definitiv ausnutzbar" zu unterscheiden. Die Falsch-Positiv-Rate blieb handhabbar.
Das System ist Teil eines größeren Multi-Agenten-Setups bei ultrathink.art, das Design, Programmierung, Marketing, Betrieb, Social Media und den dedizierten Sicherheitsagenten umfasst.
📖 Read the full source: r/clawdbot
👀 Siehe auch

Mit Claude verfasste Masterarbeit: Wirtschaftsstudent besteht mit Bestnote
Ein Wirtschaftsstudent nutzte Claude für die Literaturrecherche, Datenanalyse mit Python-Skripten und Excel sowie die Präsentation – bestand mit einer Spitzennote nahe dem PhD-Niveau. Im Anhang wurde die KI-Nutzung offengelegt, es wurden keine Fragen gestellt.

Forge-Agent behebt GitHub-Fehler autonomos mit Claude AI
Ein Forge-Agent eines Entwicklers erkannte einen GitHub-Fehlerbericht, löste eine Pipeline aus, nutzte Claude AI zur Analyse und Behebung des Problems und eröffnete einen PR – alles ohne menschliches Eingreifen, während der Entwickler schlief.

Claude Opus 4.6 analysiert Buffett-Briefe, um blind Aktien auszuwählen
Ein Entwickler nutzte Claude Code mit Subagenten, um Warren Buffetts Anlageprinzipien aus 48 Jahren Aktionärsbriefen (561.849 Wörter) zu extrahieren und wandte sie dann an, um 50 anonymisierte Aktien zu bewerten. Opus 4.6 identifizierte korrekt 60 % der tatsächlichen Beteiligungen Berkshires in seinen Top-10-Auswahlen, während es Anti-Buffett-Kontrollen ablehnte.

Benutzerdefinierte OpenClaw-Fähigkeiten für CRM- und CMS-Integration
Ein Entwickler erstellte benutzerdefinierte OpenClaw-Fähigkeiten, um mit eigenen CRM- und CMS-Systemen zu interagieren, was automatisierte Lead-Generierung und Inhaltserstellung mit menschlicher Überwachung ermöglicht. Die Einrichtung dauerte einen Tag.