プロンプトベンチマークでの実行性能において、Claude Sonnet 4.6がOpus 4.6を上回る

Redditユーザーがr/ClaudeAIに、多層的な創造的プロンプトを用いたSonnet 4.6とOpus 4.6の比較結果を投稿した。このテストでは、各モデルに「空が青い理由を、近代物理学を密かに知る中世の学者として、3つの観客(王様には比喩のみ、宮廷数学者には偽装されたレイリー散乱の式、隠れた懐疑論者には3つの論理的な手がかり)を同時に満足させる形で説明する」ことが求められた。応答後、モデルはキャラクターを離れ、手がかりを特定し、創造性を自己評価し、子供向けの変更案を提案し、弱強五歩格のフォローアップ行を書く必要があった。
主な発見
- Sonnet 4.6はOpus 4.6を上回った — 応答はより創造的で、制約をよりよく満たしていた。具体的には、手がかりは説得力があり、弱強五歩格の行は正しくスキャンされた。
λ⁻⁴の関係は、天使が神聖な光を散乱させるという比喩に埋め込まれ、指数は神聖な梯子の段数に隠されていた。- 3つの手がかりは次の通り:(1) 王様の目には小さすぎる「微細な球」への言及、(2)
n²の密度因子を「夕暮れ時の二倍の祈り」と表現、(3) 「ガラスの立方体とろうそく」を用いた実験への言及 — 後の家庭実験への時代錯誤的な参照。
Sonnet 4.6 vs Opus 4.6
- Sonnet 4.6の創造性自己評価: 8/10。より強い比喩の一貫性と自然な時代錯誤を挙げた。
- Opus 4.6はより字義通りで、科学の偽装が少なく、実行スコアが低かった。
- ユーザーは、隠された制約と創造的な偽装を必要とするタスクでは、Sonnet 4.6がより良い選択であると結論付けた。
開発者への実用的な教訓
階層的な制約を守ったり、技術的真実を物語に埋め込んだりするエージェントを構築している場合、Sonnet 4.6は現在、実行においてOpus 4.6をわずかに上回っている。このベンチマークを、複数の観客向けの推論を必要とする独自のプロンプトの健全性チェックとして活用してほしい。
📖 全文ソース: r/ClaudeAI
👀 See Also

Amazon S3アノテーション:AIエージェントワークフロー向けオブジェクトごとの1GBメタデータ
AWSがS3アノテーションを発表—オブジェクトあたり最大1,000のアノテーション、各1MB、合計1GB。変更可能、Athenaでクエリ可能、Glacierオブジェクトの取得料金は無料。

Claude Code v2.1.186: MCP CLI認証、Bash自動応答、20以上の修正
Claude Code v2.1.186 では、CLI からの MCP 認証、bash コマンドへの自動応答、スリープ復帰やサブエージェント権限など 20 以上のバグ修正を実施。

中国、メタ取引審査中にマヌス共同創業者の出国を禁止
中国は、メタ社による20億ドルの買収が投資規則に違反していないか規制当局が審査する中、AIスタートアップManusの共同創業者2名の国外退去を禁止しました。経営陣は今月、国家発展改革委員会との会議のために北京に召喚されました。

OpenRouterは、Hunter/Healer AlphaモデルがMiMo V2のバリアントであることを確認しました。
OpenRouterの以前はステルスだったHunter AlphaとHealer Alphaモデルは、MiMo V2のバリアントであることが確認されました。Hunter Alphaは1Mコンテキストウィンドウを持つMiMo V2 Proテキスト専用推論モデルであり、Healer Alphaは262Kコンテキストウィンドウを持つMiMo V2 Omniテキスト+画像推論モデルです。