Examen de sécurité multi-agent exécuté quotidiennement en production : architecture et résultats

Détails de l'architecture
L'agent de sécurité s'exécute quotidiennement via un cron launchd. Il reçoit un diff des commits récents ainsi qu'un accès complet au codebase. Il vérifie les éléments selon une liste de contrôle structurée des vulnérabilités qui inclut :
- IDOR
- Contournements d'authentification
- Vecteurs d'injection
- Exposition de secrets
- Routes trop permissives
L'agent classe les découvertes en tâches P0/P1/P2 dans la file d'attente de travail. Un agent de codage distinct les récupère, les corrige, commit les modifications et déploie.
Défis de coordination et solutions
Après 3 semaines d'exécution en production, le défi de coordination le plus intéressant a été les conflits entre l'agent de sécurité et l'agent de codage. La sécurité signale quelque chose, le codage le corrige, mais introduit ensuite un motif dans le commit suivant que la sécurité n'a pas encore examiné.
La solution mise en œuvre : exécutions uniquement quotidiennes (pas par commit) plus un marqueur "reviewed_through" pour que les découvertes aient un contexte de commit.
Observations de performance
Claude s'est révélé particulièrement doué pour distinguer "cela semble vulnérable" de "cela est définitivement exploitable dans ce contexte". Le taux de faux positifs est resté gérable.
Le système fait partie d'une configuration multi-agents plus large chez ultrathink.art qui inclut la conception, le codage, le marketing, les opérations, les réseaux sociaux et l'agent de sécurité dédié.
📖 Lire la source complète : r/clawdbot
👀 See Also

L'agent OpenClaw démontre le flux de travail d'escalade de modèle avec Claude Opus.
Un développeur décrit comment son agent OpenClaw a reconnu que Codex GPT-5.4 était bloqué sur une tâche de codage, a escaladé le problème vers Claude Opus 4.6 via Antigravity, a discuté de la solution, puis est revenu pour terminer le travail de manière autonome.
Claude Code a écrit chaque ligne d'une vidéo de lancement des années 50 dans Remotion — mais il a fallu environ 100 prompts
Un développeur détaille comment il a utilisé Claude Code pour générer chaque ligne de TypeScript/TSX pour une vidéo de lancement Remotion. Le processus a nécessité environ 100 requêtes, un brief créatif détaillé, une itération scène par scène et de fréquents git diffs.

Analyse de 7 ans de journal intime avec un LLM : échecs du RAG vs du fine-tuning
Après avoir tenu un journal depuis 2019, un développeur a alimenté un LLM avec plus de 200 entrées pour découvrir des schémas — RAG a échoué, le fine-tuning a échoué, et la confidentialité était une contrainte. L'approche finale a révélé des leçons de vie cycliques tous les deux ans.

Utiliser Claude pour Construire un Pipeline de Génération de Leads sur LinkedIn Qui a Remplacé un Devis de Freelance à 3 000 €
Un développeur a passé 30 minutes à rédiger un prompt détaillé de 2 pages avec Claude Sonnet pour créer un système de génération de leads sur LinkedIn qui identifie les posts aimants, filtre et note les prospects, et fonctionne quotidiennement sur un VPS à 5 $, remplaçant des devis de 2 000 à 5 000 € de freelancers.