Kiro CLIによるAnthropicのGenerator-Evaluator Harnessの複製:12回のイテレーションで構築されたウェブサイト

ある開発者が、GANに着想を得たAnthropicの長期間稼働アプリ向けGenerator-Evaluatorハーネスデザインを再現しました。アーキテクチャは、Planner(1回実行)の後、Generator ↔ Evaluatorループを12回繰り返します。各エージェントは独立したCLIプロセスで、共有コンテキストはゼロ、ファイル(spec.md、eval-report.md)を介してのみ通信します。EvaluatorはPlaywrightを使用してライブサイトを閲覧します(コードを読むだけではありません)。
主要なアーキテクチャ詳細
- 呼び出しごとにクリーンスレート: 各エージェントは新たに起動し、自分の入力ファイルのみを読み取ります。コンテキストの不安を防ぎます。
- テスト用のPlaywright MCP: ナビゲート、クリック、ビューポートのリサイズを行います。コードレビューでは決して見つからないビジュアルバグをキャッチします。
- Anthropicのフロントエンドデザインスキル: 一般的なAIパターン(Interフォント、紫のグラデーション、カードレイアウトなど)を明示的にペナルティします。創造的なリスクテイクを強制します。
- 継続的なイテレーション、失敗時の再試行ではない: 全12ラウンドが関係なく実行されます。各ラウンドで改善されます。
結果と統計
イテレーション1:機能的だが印象に残らない。イテレーション4:Generatorが「Terminal Noir」に転換—IBM Plex Mono、琥珀色に黒、グレインテクスチャ、スキャンライン。イテレーション5〜12:磨き、アクセシビリティ、レスポンシブ修正、動きの軽減サポート。
- 総時間:3時間20分
- イテレーション数:12(Generator + Evaluator各)
- 手動コード記述量:0行(後にいくつかの視覚的問題を修正)
- 技術:Next.js、Tailwind、Framer Motion、TypeScript
ライブ結果
https://mnemo-mcp.github.io/Mnemo/
重要な教訓
モデルはエンジンです。ハーネス—制約、フィードバックループ、対抗的構造—が、AIの粗製濫造になるか、本当に特徴的なものになるかを決定します。
📖 全文ソースを読む: r/ClaudeAI
👀 See Also

Googleアカウントの停止と復元(AIエージェント利用向け)
ある開発者がAIエージェント用に新しいGmailアカウントを作成したところ、Googleが20分以内にアカウントを停止しました。エージェントの目的とセキュリティ対策を詳細に説明した復元リクエストを提出した後、Googleは12時間以内にアクセスを復元しました。

オートエボルブ・フレームワークは、自己対戦進化を通じてゲームAI開発にクラウドコードを活用します。
ある開発者がClaude Codeのみを使用してGame AI Cupに参加し、130回の自動化された反復を通じて83名の参加者中6位を獲得しました。autoevolveフレームワークは、Claudeがボットのパフォーマンスを分析し、変更を提案し、新バージョンを以前のバージョンと比較評価する自己対戦進化ループを実装しています。

ALMA実験:100ドルと指示なしで2か月間自律的に活動するAIエージェント
ある開発者が、100ドルの暗号資産、インターネットアクセス、そして一切の指示なしで、ALMAというAIエージェントを2ヶ月間稼働させた。このエージェントは自律的に135のオリジナル作品を執筆し、慈善団体に寄付を行い、人間の介入なしに一貫した行動パターンを発展させた。

Radio Free Gemma: MeshtasticとローカルLLMによる災害AI
開発者がMeshtasticとOpenClawを使用してメッシュネットワーク上でGemma 4:26Bモデルをローカル実行し、携帯電話がダウンした際にラジオ経由でRAGベースの緊急情報を提供します。