Reproduktion von Anthropics Generator-Evaluator-Harnisch mit Kiro CLI: Ein 12-iterativer Website-Bau

✍️ OpenClawRadar📅 Veröffentlicht: 17. Mai 2026🔗 Source
Reproduktion von Anthropics Generator-Evaluator-Harnisch mit Kiro CLI: Ein 12-iterativer Website-Bau
Ad

Ein Entwickler hat Anthropics Generator-Evaluator-Harness-Design für langlebige Anwendungen nachgebaut, inspiriert von GANs. Die Architektur: ein Planer (läuft einmal) und dann eine Generator ↔ Evaluator-Schleife für 12 Iterationen. Jeder Agent ist ein separater CLI-Prozess ohne gemeinsamen Kontext, die nur über Dateien (spec.md, eval-report.md) kommunizieren. Der Evaluator verwendet Playwright, um die Live-Site zu durchsuchen – nicht nur den Code zu lesen.

Wichtige Architekturdetails

  • Neuanfang pro Aufruf: Jeder Agent startet frisch und liest nur seine Eingabedateien. Verhindert Kontextangst.
  • Playwright MCP zum Testen: Navigiert, klickt, ändert Viewport-Größen. Erwischt visuelle Bugs, die Code-Reviews nie finden würden.
  • Anthropics Frontend-Design-Fähigkeit: Bestraft explizit generische KI-Muster (Inter-Schriftart, lila Verläufe, Kartenlayouts). Erzwingt kreative Risikobereitschaft.
  • Kontinuierliche Iteration, kein Wiederholen bei Fehlern: Alle 12 Runden laufen immer durch. Jede verbessert das Ergebnis.
Ad

Ergebnisse & Statistiken

Iteration 1: funktional aber unspektakulär. Iteration 4: Generator schwenkte auf „Terminal Noir“ – IBM Plex Mono, Bernstein auf Schwarz, Kornstrukturen, Scanlines. Iterationen 5-12: Feinschliff, Barrierefreiheit, responsives Design, reduziert Bewegung.

  • Gesamtzeit: 3h 20min
  • Iterationen: 12 (Generator + Evaluator jeweils)
  • Manuell geschriebener Code: 0 Zeilen (danach ein paar visuelle Korrekturen)
  • Technologie: Next.js, Tailwind, Framer Motion, TypeScript

Live-Ergebnis

https://mnemo-mcp.github.io/Mnemo/

Wichtigste Erkenntnis

Das Modell ist der Motor. Das Harness – Einschränkungen, Feedbackschleifen und adversarische Struktur – bestimmt, ob man KI-Schrott oder etwas wirklich Originelles bekommt.

📖 Vollständige Quelle lesen: r/ClaudeAI

Ad

👀 Siehe auch

Praktische Anwendungsfälle für OpenClaw aus der Community
Anwendungsfälle

Praktische Anwendungsfälle für OpenClaw aus der Community

Entwickler und Teams nutzen OpenClaw für Cold Outreach, SEO-Content-Automatisierung, Social-Media-Management, Kunden-Datenabfragen, Website-Tests, Server-Monitoring, Belegverarbeitung, Autokauf-Verhandlungen, Podcast-Kapitelerstellung und tägliche Zielplanung.

OpenClawRadar
Claude-Zeitreisespiel entwickelt sich von einer Eingabeaufforderung zu einem vollständig eingesetzten System
Anwendungsfälle

Claude-Zeitreisespiel entwickelt sich von einer Eingabeaufforderung zu einem vollständig eingesetzten System

Ein Reddit-Nutzer beschreibt, wie er über 40 Tage hinweg ein Zeitreise-RPG-Prompt in Claude zu einem komplexen System weiterentwickelt hat, indem er YAML-Zustandsdateien, über 50 NPCs, Ereignisauslöser hinzufügte und es schließlich auf Fly mit einer Datenbank und einem benutzerdefinierten MCP-Server für plattformübergreifenden Zugriff bereitstellte.

OpenClawRadar
Mit Lovable + Claude + Gemini eine vollständige App entwickeln: Eine Fallstudie
Anwendungsfälle

Mit Lovable + Claude + Gemini eine vollständige App entwickeln: Eine Fallstudie

Ein Softwareentwickler baute Earnest, einen Bankbonus-Tracker, mit Lovable für die UI, Claude zum Verständnis der Absicht und Gemini als zweite Meinung. Die App hat jetzt über 100 Nutzer, die über 9.700 $ an Boni verfolgen.

OpenClawRadar
Verwendung des SkyClaw-Bots von OpenClaw zur persönlichen Ausgabenverfolgung über Discord und Google Sheets
Anwendungsfälle

Verwendung des SkyClaw-Bots von OpenClaw zur persönlichen Ausgabenverfolgung über Discord und Google Sheets

Ein Nutzer beschreibt die Verwendung von SkyClaw, einem Cloud-nativen Bot, der von OpenClaw betrieben wird, um Ausgaben über Discord-Nachrichten und Quittungsbilder zu erfassen, die automatisch einem Google Sheet hinzugefügt werden, ohne Zugriff auf sensible persönliche Konten zu benötigen.

OpenClawRadar