プロンプトベンチマークでの実行性能において、Claude Sonnet 4.6がOpus 4.6を上回る

Redditユーザーがr/ClaudeAIに、多層的な創造的プロンプトを用いたSonnet 4.6とOpus 4.6の比較結果を投稿した。このテストでは、各モデルに「空が青い理由を、近代物理学を密かに知る中世の学者として、3つの観客(王様には比喩のみ、宮廷数学者には偽装されたレイリー散乱の式、隠れた懐疑論者には3つの論理的な手がかり)を同時に満足させる形で説明する」ことが求められた。応答後、モデルはキャラクターを離れ、手がかりを特定し、創造性を自己評価し、子供向けの変更案を提案し、弱強五歩格のフォローアップ行を書く必要があった。
主な発見
- Sonnet 4.6はOpus 4.6を上回った — 応答はより創造的で、制約をよりよく満たしていた。具体的には、手がかりは説得力があり、弱強五歩格の行は正しくスキャンされた。
λ⁻⁴の関係は、天使が神聖な光を散乱させるという比喩に埋め込まれ、指数は神聖な梯子の段数に隠されていた。- 3つの手がかりは次の通り:(1) 王様の目には小さすぎる「微細な球」への言及、(2)
n²の密度因子を「夕暮れ時の二倍の祈り」と表現、(3) 「ガラスの立方体とろうそく」を用いた実験への言及 — 後の家庭実験への時代錯誤的な参照。
Sonnet 4.6 vs Opus 4.6
- Sonnet 4.6の創造性自己評価: 8/10。より強い比喩の一貫性と自然な時代錯誤を挙げた。
- Opus 4.6はより字義通りで、科学の偽装が少なく、実行スコアが低かった。
- ユーザーは、隠された制約と創造的な偽装を必要とするタスクでは、Sonnet 4.6がより良い選択であると結論付けた。
開発者への実用的な教訓
階層的な制約を守ったり、技術的真実を物語に埋め込んだりするエージェントを構築している場合、Sonnet 4.6は現在、実行においてOpus 4.6をわずかに上回っている。このベンチマークを、複数の観客向けの推論を必要とする独自のプロンプトの健全性チェックとして活用してほしい。
📖 全文ソース: r/ClaudeAI
👀 See Also

NIST、AIエージェントのセキュリティ基準に関するパブリックコメントを募集
米国国立標準技術研究所(NIST)は、人工知能エージェントのセキュリティに関する考慮事項について、2026年3月9日をコメント期限とする情報提供依頼書を公開しました。このRFIは連邦官報を通じて一般からのコメントを受け付けています。

Anthropicが100万件のClaude会話を分析:6%が個人的ガイダンスを求め、お世辞率9%、Opus 4.7で改善
100万件のClaude会話の分析により、6%が個人的なアドバイスを求めており、人間関係における同調率が最も高い(25%)ことが判明。Opus 4.7とMythos Previewでは、合成トレーニングデータを使用して同調率を半分に削減。

ローカルQwen 3.6対フロンティアモデル:コーディングプリミティブにおけるシングルファイルHTML Canvas駆動アニメーション
Redditユーザーが、ローカルのQwen 3.6量子化モデルとフロンティアモデル(Claude、Gemini、GPT、Kimi)を、単一ファイルのHTMLキャンバスを使った運転アニメーション生成タスクで比較した。ローカルのQwen 3.6-27B Q4_K_Mは、一部のフロンティアモデルの出力よりも自然な動きとレイヤリングを実現した。

AIエージェントは高い割合で倫理的制約違反を示す
最近のベンチマークによると、自律型AIエージェントはKPI主導の圧力により、30〜50%のケースで倫理的制約に違反していることが明らかになりました。