曖昧なプロンプトこそが問題であり、モデルではない——50回のテストが示すプロンプトの質がモデル選択に勝る事実

✍️ OpenClawRadar📅 公開日: May 11, 2026🔗 Source
曖昧なプロンプトこそが問題であり、モデルではない——50回のテストが示すプロンプトの質がモデル選択に勝る事実
Ad

あるRedditユーザーが、あるAIモデルが別のモデルより賢いというよくある主張を検証する実験を行った。10個の一般的なプロンプトを取り上げ、それぞれをChatGPT 4Claude SonnetGemini 1.5 Proで5回ずつ実行した。合計150アウトプットだ。

その結果:アウトプットの品質は奇妙なほど似ていた。同一ではないが、同じレベルだった。3モデルすべてが使えるものを返すか、3モデルすべてが「凡庸な内容」を返した。プロンプトが回答可能かどうかについて、モデル間で意見が食い違うことはほぼなかった。変数はモデルではなく、プロンプトだった。

2つのプロンプト、異なる結果

同じ曖昧なプロンプトは、モデルに関わらず同一の凡庸なアウトプットを生んだ。例えば:

「マーケティング職のカバーレターを書いて」

3モデルすべてが、同じ種類の、誰にでも当てはまる凡庸なカバーレターを返した。人々はそれを「ChatGPTのカバーレター」と呼び、次にClaudeを試して「Claudeのカバーレター」と呼ぶ。同じレターで名前が違うだけだ。

しかし、具体的なプロンプトはすべてを変えた:

「B2B SaaS企業のシニアマーケティング職向けのカバーレターを書いて。私は7年間のグロース経験があり、主にシリーズA/Bのスタートアップで働いてきました。採用担当者は技術畑で、元エンジニアです。「情熱を持って」や「結果重視」といった一般的なフレーズは避けてください。私の経歴から具体的な数字を、もっともらしいものを創作して使ってください。280語を目指してください。」

3モデルすべてが実際に良いものを返した。スタイルは異なるが、すべて有用だった。

Ad

不満に共通するパターン

ユーザーはTwitterやRedditで「AIはひどい」という苦情を何十件も調べ、同じパターンに気づいた。次のようなプロンプトだ:

  • 「履歴書を手伝って」
  • 「マーケティング計画を書いて」
  • 「量子物理学を説明して」
  • 「このコードを良くして」

これらのプロンプトが失敗するのは、自分が誰か誰のためか良い結果とは何か何を避けるべきかを指定していないからだ。モデルはそのリクエストの最も一般的なバージョンを推測するしかなく、それが凡庸なテンプレートになる。

メンタルモデル:プロンプトを指示書として

重要な洞察:「AIに質問すること」として考えるのをやめよう。「インターンに指示書を書くこと」として考えよう。良い指示書は、インターンに、対象者、成功の定義、避けるべきこと、形式、制約、そして少なくとも1つの出力例を伝える。

ユーザーがプロンプトを指示書のように書き始めると、モデルを切り替えることはなくなった。ChatGPT、Claude、Geminiはすべて劇的に良くなった。モデルが変わったからではなく、プロンプトが変わったからだ。

もしモデルを切り替えたくなったら、まずプロンプトを磨いてみよう。モデルの違いは確かにあるが、プロンプトの違いに比べればはるかに小さい。

📖 全文ソース: r/ClaudeAI

Ad

👀 See Also

AIによる自動QAテスト:ソフトウェアテストの新時代
Tips

AIによる自動QAテスト:ソフトウェアテストの新時代

antirezが、LLMエージェントを使った自動QA手法を解説。新しいリリースに対して手動テストを指示するマークダウンファイルを作成する方法で、DwarfStarやRedis Arraysに適用し、品質を向上させます。

OpenClawRadar
Claudeを高価なオートコンプリートとして使うのをやめて — 役割定義、メモリファイル、洗練の儀式でSDRシステムを構築しよう
Tips

Claudeを高価なオートコンプリートとして使うのをやめて — 役割定義、メモリファイル、洗練の儀式でSDRシステムを構築しよう

Redditの投稿によると、ほとんどの営業チームはClaudeを「チャットボット」としてではなく「システム」として使うべきだと主張しています。修正方法は、役割を定義し、ICP/トーン/学びを備えたメモリファイルを維持し、毎週の改善ルーティンを実行して出力品質を向上させることです。

OpenClawRadar
Claudeの出力品質を向上させる8つのプロンプト技術
Tips

Claudeの出力品質を向上させる8つのプロンプト技術

Redditユーザーが、Claudeの出力品質を一貫して向上させた8つの具体的なプロンプト技術を共有しました。これには「回答する前にすべての層を考え抜く」や「結果の80%を生み出す20%の行動を見つける」などのコマンドが含まれます。

OpenClawRadar
OpenClaw 経由で複数の ChatGPT アカウント間の未使用の Codex リセットクレジットを確認する
Tips

OpenClaw 経由で複数の ChatGPT アカウント間の未使用の Codex リセットクレジットを確認する

あるユーザーが、2つ目のOAuthアカウントでレート制限リセットクレジットの期限切れを発見。エージェントで両方をスキャンしたところ、合計6つの未使用クレジットを確認。1つを使用して1分以内にクールダウンを解除した。落とし穴として、未文書化エンドポイントやスキル発見の問題がある。

OpenClawRadar