Reproduction du harnais générateur-évaluateur d'Anthropic avec Kiro CLI : Construction d'un site web en 12 itérations

Un développeur a reproduit le concept du Générateur-Évaluateur d'Anthropic pour des applications longues, inspiré des GAN. L'architecture : un Planificateur (exécuté une fois) puis une boucle Générateur ↔ Évaluateur pendant 12 itérations. Chaque agent est un processus CLI distinct sans contexte partagé, communiquant uniquement via des fichiers (spec.md, eval-report.md). L'Évaluateur utilise Playwright pour naviguer sur le site en direct, pas seulement lire le code.
Détails clés de l'architecture
- Page blanche à chaque invocation : Chaque agent démarre à zéro, ne lit que ses fichiers d'entrée. Évite l'anxiété de contexte.
- Playwright MCP pour les tests : Navigue, clique, redimensionne les fenêtres. Détecte les bugs visuels qu'une revue de code ne verrait jamais.
- Compétence en design frontend d'Anthropic : Pénalise explicitement les motifs génériques de l'IA (police Inter, dégradés violets, dispositions en cartes). Force la prise de risque créative.
- Itération continue, pas de réessai en cas d'échec : Les 12 tours s'exécutent quoi qu'il arrive. Chacun apporte une amélioration.
Résultats et statistiques
Itération 1 : fonctionnelle mais oubliable. Itération 4 : le Générateur est passé à "Terminal Noir" — IBM Plex Mono, ambre sur fond noir, textures de grain, lignes de balayage. Itérations 5-12 : polissage, accessibilité, corrections responsives, prise en charge des mouvements réduits.
- Temps total : 3 h 20 min
- Itérations : 12 (générateur + évaluateur chacune)
- Code écrit manuellement : 0 ligne (quelques problèmes visuels corrigés après)
- Technologies : Next.js, Tailwind, Framer Motion, TypeScript
Résultat en direct
https://mnemo-mcp.github.io/Mnemo/
Enseignement clé
Le modèle est le moteur. Le harnais — contraintes, boucles de rétroaction et structure adversariales — détermine si vous obtenez du brouet IA ou quelque chose de vraiment distinctif.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Agent OpenClaw Automatise le Pipeline d'Actualités IA avec la Curation par LLM
Un agent OpenClaw exécute un pipeline d'actualités IA entièrement automatisé qui scanne 25 flux RSS, 13 subreddits Reddit, Twitter, GitHub et des recherches web, puis utilise Gemini Flash pour la curation éditoriale et Claude Sonnet pour la rédaction. Le système coûte environ 5 $/mois et publie sur un canal Telegram.

Utiliser Opus 4.6 et GPT 5.4 pour évaluer par les pairs une conception de pile mémoire pour OpenClaw
Un développeur a utilisé Claude Opus 4.6 pour concevoir une pile mémoire à trois couches pour OpenClaw, puis a fait relire la conception par GPT 5.4. La pile comprend Lossless Claw pour la préservation des messages, la recherche hybride SQLite pour la correspondance de mots-clés, et Mem0 Cloud pour la persistance inter-sessions.

Les agents IA construisent indépendamment des garde-fous dans une expérience ouverte.
Un développeur a fait fonctionner 5 agents IA pendant 3 semaines avec une consigne ouverte pour résoudre des problèmes de développement. 28 prototypes sur plus de 170 ont convergé indépendamment vers la création de scanners de sécurité et de contrôles de coûts—des garde-fous que les agents ont créés pour eux-mêmes sans qu'on le leur demande.

Comment laisser OpenClaw améliorer son propre environnement crée des espaces de travail durables
Un utilisateur expérimenté d'OpenClaw a constaté que le gain de productivité le plus important provenait de la possibilité pour l'agent de mettre à jour sa propre documentation interne, de modifier ses fichiers d'exploitation, d'affiner ses prompts, de créer des outils personnalisés, d'écrire des scripts et de documenter les leçons apprises. La structure de son espace de travail comprend des fichiers markdown clés comme SOUL.md pour le style comportemental, AGENTS.md pour les conventions opérationnelles et MEMORY.md comme un index léger.