Kiro CLIによるAnthropicのGenerator-Evaluator Harnessの複製:12回のイテレーションで構築されたウェブサイト

ある開発者が、GANに着想を得たAnthropicの長期間稼働アプリ向けGenerator-Evaluatorハーネスデザインを再現しました。アーキテクチャは、Planner(1回実行)の後、Generator ↔ Evaluatorループを12回繰り返します。各エージェントは独立したCLIプロセスで、共有コンテキストはゼロ、ファイル(spec.md、eval-report.md)を介してのみ通信します。EvaluatorはPlaywrightを使用してライブサイトを閲覧します(コードを読むだけではありません)。
主要なアーキテクチャ詳細
- 呼び出しごとにクリーンスレート: 各エージェントは新たに起動し、自分の入力ファイルのみを読み取ります。コンテキストの不安を防ぎます。
- テスト用のPlaywright MCP: ナビゲート、クリック、ビューポートのリサイズを行います。コードレビューでは決して見つからないビジュアルバグをキャッチします。
- Anthropicのフロントエンドデザインスキル: 一般的なAIパターン(Interフォント、紫のグラデーション、カードレイアウトなど)を明示的にペナルティします。創造的なリスクテイクを強制します。
- 継続的なイテレーション、失敗時の再試行ではない: 全12ラウンドが関係なく実行されます。各ラウンドで改善されます。
結果と統計
イテレーション1:機能的だが印象に残らない。イテレーション4:Generatorが「Terminal Noir」に転換—IBM Plex Mono、琥珀色に黒、グレインテクスチャ、スキャンライン。イテレーション5〜12:磨き、アクセシビリティ、レスポンシブ修正、動きの軽減サポート。
- 総時間:3時間20分
- イテレーション数:12(Generator + Evaluator各)
- 手動コード記述量:0行(後にいくつかの視覚的問題を修正)
- 技術:Next.js、Tailwind、Framer Motion、TypeScript
ライブ結果
https://mnemo-mcp.github.io/Mnemo/
重要な教訓
モデルはエンジンです。ハーネス—制約、フィードバックループ、対抗的構造—が、AIの粗製濫造になるか、本当に特徴的なものになるかを決定します。
📖 全文ソースを読む: r/ClaudeAI
👀 See Also

開発者がClaude AIを活用してクラウド認定クイズアプリを構築
ある開発者が、AWS、GCP、Azureのクラウド認定試験対策のためのクイズアプリ「Kwizeo」を構築しました。このアプリでは、Claude AIを活用して問題の生成、進捗ロジックの設計、開発の加速を行っています。

ソロ開発者がGeminiの無料枠で4つのAIエージェントを運用する会社を経営
台湾の開発者が、OpenClawとGemini 2.5 Flashの無料枠(1日1,500リクエスト)を使用して4つのAIエージェントを構築し、コンテンツ生成、セールスリード、セキュリティスキャン、テックエージェンシーの運営を自動化しました。月間のLLMコストは0ドルです。

開発者、金融AIエージェントにDeepSeekからGrokへの切り替えを検討
FastAPI/Pythonで金融AIウェブアプリを構築している開発者が報告したところ、DeepSeek V3.2 ReasoningはTTFTが70秒、出力速度が約25トークン/秒で、ストリーミング体験が非常に悪いとのこと。彼らはTTFT約15秒、出力速度約75トークン/秒のGrok 4.1 Fast Reasoningへの切り替えを検討中。

OpenClawエージェントを使用してWixからWordPressに移行 — 現在は3Dプリントショップの日常業務を管理
小規模な3Dプリントショップが、VPSにデプロイされたOpenClawエージェントを使ってWixからWordPressに移行しました。このエージェントは現在、新製品の追加やペットバッジ注文のカスタム注文フォームの作成を行っています。