GSD-Lite: TDDを強制しテストスキップを防止するClaudeコード用ステートマシン

GSD-Liteは、Claude Codeに組み込まれるオープンソースのMCPサーバーで、プロジェクトを12段階のワークフローマシンで実行します。このツールはMITライセンスで、合計約15のソースファイルで構成されています。
仕組み
Claudeとの対話で構築内容を計画した後、GSD-Liteが自動的に引き継ぎます:コードを書き、レビューし、検証し、次のフェーズに進みます。実行ループは次のパターンに従います:
- オーケストレーターが次のタスクを選択
- エグゼキューターがコードを記述(TDD、チェックポイント)
- レビュアーがチェック(分離されたコンテキスト、仕様+品質)
- 承認?次のタスク。却下?再作業。
- すべてのタスク完了?フェーズゲートチェック
- ゲート通過?次のフェーズ
- すべてのフェーズ完了?完了
主な機能
TDDの強制:「鉄の法則」がすべてのタスクディスパッチに組み込まれています:失敗するテストなしに本番コードは書けません。プロンプトには、Claudeがテストをスキップするために使用する具体的な合理化(「これは単なる設定変更です」「既存のテストで既にカバーされています」)がリストされ、既知の言い訳としてフラグが立てられます。
分離されたエージェントコンテキスト:レビューは分離されたエージェントコンテキストで実行され、レビュアーはエグゼキューターの推論を一切見ません—差分とタスク仕様のみを見ます。これにより、形式的な承認を防ぎ、実際のバグを発見しやすくします。
デバッガーエージェント:タスクが3回失敗した場合、再試行ではなくデバッガーエージェントがディスパッチされます。この分離されたエージェントは失敗を再現し、仮説を立て、テストし、修正箇所を特定し、その後エグゼキューターに調査結果を提供します。
依存関係の追跡:あるタスクがAPIシグネチャを変更した場合、下流のすべてが自動的に無効化され、再キューイングされます。
技術的詳細
このシステムは6つのコマンド、4つのエージェント、11のMCPツールを使用しています。状態は1つのJSONファイルで管理され、スキーマ検証とバージョン競合は楽観的並行性制御で処理されます。
オリジナルバージョンではない理由
最初のバージョンには32のコマンド、12のエージェント、100以上のソースファイル、2400行のインストーラーがありました。著者は、その複雑さの大部分がコンテキストウィンドウを消費するだけで価値を提供していなかったため、それを破棄して一から書き直しました。
予想外の発見
反合理化アプローチは機能します—Claudeがステップをスキップするために使用する特定のフレーズをエージェントプロンプトに直接リストすることで、スキップ率が減少しました。著者は、否定的な例が「常にテストを書く」と言うだけよりもモデルをよりよく導くように見えると指摘しています。セッションの永続性が最も難しい実装上の課題でした。
📖 Read the full source: r/ClaudeAI
👀 See Also

Claude Codeプラグインがローカルでトークンの無駄と異常を分析します
開発者が、ローカルセッションデータから6種類の異常を検出してトークンの無駄を診断するClaude Codeプラグインを構築しました。このツールは8,392セッションを分析し、1,015件の異常を発見しました。最も多かったのはExcessiveToolUseでした。

デクロー:コミュニティ主導のOpenClawマルウェアスキャナー
Declawedは、ClawHubスキルにおける任意のプロンプトインジェクション、悪意のあるコンテンツ、情報窃取ツールを検出することに焦点を当てた、新しいOpenClaw SKILL.mdマルウェアスキャナーです。

テラリウム:エイジェンティック環境のためのタイムマシン・リワインド機能付きオープンソースサンドボックス
複数のAIエージェントを安全に実行できる多用途サンドボックス。分離されたワールド、リバースプロキシ管理、GUI、タイムマシン機能でコンテナ状態を巻き戻せます。

開発者がオープンソースAIスキルを構築し、スタートアップアイデアを検証、わずか10分で自らのアイデアを断念
ある開発者が、ブレインストーミングから財務予測まで、スタートアップの検証を8つのフェーズで進めるオープンソースのAIスキル「startup-design」を構築しました。自身のスタートアップアイデアでテストしたところ、このスキルは厳しい質問を投げかけ、その特定のコンセプトに対して自分が適切な創業者ではないことを明らかにしました。