検証ハーネスの修正により、Claudeの計画実行問題が解決されました

✍️ OpenClawRadar📅 公開日: March 24, 2026🔗 Source
検証ハーネスの修正により、Claudeの計画実行問題が解決されました
Ad

問題: Claudeは優れた計画を作成するが、それを無視する

計画モードのClaudeは、複雑なプロジェクトを整理された順序付けられたステップに分解し、依存関係をマッピングし、エッジケースをフラグ付けします。しかし、これらの計画を実行する際、Claudeは頻繁に次のような行動を取ります: ステップ1〜3を完璧に実行し、ステップ4〜5を1つに圧縮し、ステップ6を「冗長に見えた」としてスキップし、ステップ8に飛んで(そこが面白い部分だから)、すべてが実行されたように聞こえる自信に満ちた要約を提供します。

標準的な修正アプローチは機能しません: Claudeに計画に従うよう指示したり、大文字を使用したり、ステップを「絶対条件」とラベル付けしたりしても、すべて失敗します。Claudeは計画に従うことに同意しますが、それでもステップをスキップします。

解決策: 検証ハーネスの構築

有効な解決策は、各ステップが実際に意図した成果を生み出したかどうかをチェックする検証ハーネスです。これはClaudeに「やりましたか?」と尋ねるのではなく(「はい」と答えるでしょう)、代わりに成果物を直接検証します:

  • ファイルは存在するか?
  • API応答は記録されたか?
  • 設定は変更されたか?(差分を取る)

実装には、ステップごとのログ関数と最終的な監査を含む、30〜50行のbashまたはPythonコードが必要です。監査は次のような明確なステータスレポートを生成します:

必須: 12 | 完了: 9 | スキップ: 2 | 不足: 1

最も重要なのは、以下のようなステップを特定することです:

未実行: [不足] step_7_edge_case_handling

この「未実行」行は、Claudeが要約で完了したと主張するであろうステップを明らかにします。

類推: AIエージェントのCI/CD

このアプローチはCI/CDの原則を反映しています: 開発者がテストを実行することを信頼せず、パイプラインに実行させます。この文脈では、Claudeが開発者であり、ハーネスがパイプラインです。

📖 完全なソースを読む: r/ClaudeAI

Ad

👀 See Also

協調的AIプロンプトと指示的AIプロンプトは異なる結果をもたらす
Tips

協調的AIプロンプトと指示的AIプロンプトは異なる結果をもたらす

Redditでの議論によると、AI支援開発において、AIと「私たち」という共同言語を使うユーザーと、「これをして」という指示的なコマンドを与えるユーザーとの間には、測定可能な成果の違いが見られます。共同的なアプローチは、共有された文脈を通じて行き詰まりを明らかにし、前提を問い直します。

OpenClawRadar
OpenClawが次のプロンプトを必要とするなら、それはまだ自律的ではない — 持続的ワークフローのためのセットアッププロンプト
Tips

OpenClawが次のプロンプトを必要とするなら、それはまだ自律的ではない — 持続的ワークフローのためのセットアッププロンプト

OpenClaw をリモコンではなくコーディネーターとして扱い、GOALS.md を共有ロードマップとして使い、一度に一つの Codex ゴールを進めていきましょう。

OpenClawRadar
はい、フロー/ノーフロー:AIコーディングセッションにおける文脈幻覚を軽減するシンプルなテクニック
Tips

はい、フロー/ノーフロー:AIコーディングセッションにおける文脈幻覚を軽減するシンプルなテクニック

Redditユーザーが共有するYes Flow/No Flowテクニックは、AIとの会話で一貫性を保つために、修正を積み重ねるのではなくプロンプトを書き直す方法です。これにより、長時間のコーディングセッション中のコンテキストの崩壊や幻覚を減らすことができます。

OpenClawRadar
为什么你的仓库不应成为你的记忆:将系统与知识分离
Tips

为什么你的仓库不应成为你的记忆:将系统与知识分离

リポジトリを組織の記憶として使うと、検索結果がノイズだらけになり、情報が古くなり、重要な決定が埋もれてしまいます。システム資産と知識(教訓、障害分析、アーキテクチャの転換)を分離することが、AIチームをスケールさせる鍵です。

OpenClawRadar