Mehr-Agenten-Sicherheitsüberprüfung läuft täglich in der Produktion: Architektur und Erkenntnisse

Architekturdetails
Der Sicherheitsagent läuft täglich über einen Cron-Job via launchd. Er erhält einen Diff der letzten Commits sowie vollen Zugriff auf die Codebasis. Er prüft anhand einer strukturierten Schwachstellen-Checkliste, die Folgendes umfasst:
- IDOR
- Authentifizierungsumgehungen
- Injektionsvektoren
- Exponierte Geheimnisse
- Zu freizügige Routen
Der Agent erfasst die Ergebnisse als P0/P1/P2-Aufgaben in der Arbeitswarteschlange. Ein separater Programmieragent nimmt sie auf, behebt sie, committet die Änderungen und führt sie aus.
Koordinationsherausforderungen und Lösungen
Nach 3 Wochen Produktivbetrieb war die interessanteste Koordinationsherausforderung der Konflikt zwischen Sicherheits- und Programmieragent. Sicherheit markiert etwas, Programmierung behebt es, führt aber im nächsten Commit ein Muster ein, das Sicherheit noch nicht überprüft hat.
Die umgesetzte Lösung: Nur tägliche Durchläufe (nicht pro Commit) plus ein "reviewed_through"-Marker, damit Ergebnisse Commit-Kontext haben.
Leistungsbeobachtungen
Claude fiel als ungewöhnlich gut darin auf, zwischen "das sieht angreifbar aus" und "das ist in diesem Kontext definitiv ausnutzbar" zu unterscheiden. Die Falsch-Positiv-Rate blieb handhabbar.
Das System ist Teil eines größeren Multi-Agenten-Setups bei ultrathink.art, das Design, Programmierung, Marketing, Betrieb, Social Media und den dedizierten Sicherheitsagenten umfasst.
📖 Read the full source: r/clawdbot
👀 Siehe auch

OpenClaw-Agent implementiert autonome Selbstverbesserungsschleife mit nächtlichen Traumzyklen
Ein OpenClaw-Benutzer hat seinen Agenten so konfiguriert, dass er einen nächtlichen 'Traumzyklus' durchführt, der KI-Forschung scannt, die Leistung reflektiert und sichere Verbesserungen autonom implementiert. Der Zyklus kostet etwa 0,40 US-Dollar pro Nacht durch Modell-Routing mit Haiku für das Scannen und Opus für die Beurteilung.

Autonomes Testen von Super Mario mithilfe von Verhaltensmodellen
Erkunden Sie autonomes Testen in Super Mario mithilfe eines mutationsbasierten Eingabegenerators, um Randfälle zu entdecken und die Zustandsräume effektiver zu erkunden.

LLMs generieren SQL-Abfragen, um Terabytes von CI-Logs in Sekunden zu analysieren.
Mendrals KI-Agent verfolgte einen flackenden Test bis zu einer Abhängigkeitsaktualisierung drei Wochen zuvor, indem er eigene SQL-Abfragen schrieb, Hunderte Millionen Log-Zeilen über ein Dutzend Abfragen in Sekunden durchsuchte. Das System verarbeitet wöchentlich 1,5 Milliarden CI-Log-Zeilen, die in ClickHouse mit 35:1 komprimiert werden.

Entwickler baut 6 Claude-KI-Agenten, um 15 Nebenprojekte zu verwalten
Ein Entwickler mit einem Vollzeit-Ingenieurjob hat sechs spezialisierte Claude-Agenten erstellt, um den täglichen Betrieb für 15 Nebenprojekte zu bewältigen, wobei er Claude Code, Markdown-Dateien und Git-Worktrees ohne eine benutzerdefinierte Plattform verwendet.