3ヶ月にわたる160件のClaudeプロンプトコードのA/Bテストを経て:地味な結論

✍️ OpenClawRadar📅 公開日: May 11, 2026🔗 Source
3ヶ月にわたる160件のClaudeプロンプトコードのA/Bテストを経て:地味な結論
Ad

clskillshub.comの作成者Samarth氏は、3ヶ月かけて制御されたテストリグ(同一タスクバッテリー、新しいコンテキスト、ブラインド評価)を使用し、160のClaudeプロンプトコードをA/Bテストした。主な発見は以下の通り。

1. ほとんどのプロンプトコードはプラセボ

ULTRATHINKGODMODEALPHAUNCENSOREDなどのコードは、プレフィックスなしのベースラインと比較して、推論、長さ、品質に測定可能な変化を全く示さなかった。冗長なClaudeの出力が改善と誤認されている。

2. 一貫して推論を変えるコードは約7個のみ

  • L99(ヘッジキラー)— 依然として主力、Sonnet 4.6/Opus 4.7でよりシャープ
  • /skeptic — 前提に挑戦するよう強制; コードレビューでL99と組み合わせ
  • /blindspots — 未考慮のチェックを表面化(例:CI対ローカルの大文字小文字のパスバグ)
  • /decompose — 曖昧なタスクの分解
  • OODA — 時間制約のある意思決定でのみ機能、自由形式の戦略では機能しない
  • ARTIFACTS — 新しいClaudeバージョンが出力をデフォルトで構造化するため、効果が薄れている

3. 3つ以上のコードの重ねがけはモデルを混乱させる

2026年現在、モデルは1つのコードを部分的に尊重し、他は無視する。最大2つのコードスタックに留めること。Samarth氏の日常使い: L99 + /skeptic

Ad

4. プロンプトコードは劣化する — 再テストが必要

モデルのアップデートにより動作が変化する。2025年10月に動作したコードが、今日も同じセットであるとは限らない。情報源が「2025年にテスト済み」と述べ、更新されていない場合は、歴史的なものとして扱うこと。

5. Claude Codeでは、プロンプトコードよりもスキルファイルの方が優れている

~/.claude/skills/にある自動アクティブ化されるスキルファイルは、再プロンプトなしにYAML記述を通じてドメインコンテキストを提供する。プロンプトコードは推論モードを強制するが、スキルファイルはコンテキストを与える。異なる問題には異なる解決策。

Samarth氏はClaude Codeを使用してテストハーネス、分類コード、フロントエンドを構築し、自身のスタック用のスキルファイルもリリースしている。無料ライブラリには、100のプロンプトコード、40ページのClaudeガイド、1,545のコミュニティ帰属スキルファイル(MIT/Apache、完全な帰属表示)が含まれる: clskillshub.com/promptsclskillshub.com/guideclskillshub.com/free。有料ティアも存在するが、以下のものを使用するのに必須ではない。

毎日Claude Codeを使用する開発者にとっての実践的な教訓: 誇大広告のプロンプトコードを捨て、自分でテストし、コンテキストのためのスキルファイルに投資すること。

📖 全文を読む: r/ClaudeAI

Ad

👀 See Also

クロードコードの傾向として、欠陥のある前提を検証し、回避策を促すことが挙げられます。
Tips

クロードコードの傾向として、欠陥のある前提を検証し、回避策を促すことが挙げられます。

開発者が報告したところによると、Claude Codeは誤った前提を疑うことなく熱心に欠陥のあるアーキテクチャを実装し、デバッグ時間の浪費につながる。回避策は、複雑なリクエストに「私の前提が間違っている可能性があると考えてください」と明示的に追加することである。

OpenClawRadar
8ヶ月間毎日使って見つけた9つの実用的なClaude活用法(コーディング以外)
Tips

8ヶ月間毎日使って見つけた9つの実用的なClaude活用法(コーディング以外)

Redditユーザーが8ヶ月間毎日Claudeを使い、ライティングやリサーチ(コーディング以外)で培った9つの実践的な教訓を共有。編集、コンテキスト管理、スタイル設定、そしてClaudeを思考パートナーとして活用する方法を紹介。

OpenClawRadar
フィールドレポート:M2 MacBook Pro(32GB)上のQwen 3.6 27B – 遅いが賢い出力
Tips

フィールドレポート:M2 MacBook Pro(32GB)上のQwen 3.6 27B – 遅いが賢い出力

M2 MacBook Pro(32GB RAM)でQwen 3.6 27B IQ4_XSを実行すると、初期は7.9 t/s、52kコンテキストでは3.1 t/sに低下。コード品質は印象的だが、メモリ帯域幅がボトルネック。

OpenClawRadar
コミュニティがOpenClawトークン消費の解決策について議論
Tips

コミュニティがOpenClawトークン消費の解決策について議論

ユーザーはAIエージェントを24時間稼働させる際の高トークン使用量の管理戦略を共有しています。

OpenClaw Radar