Opus 4.6 拡張思考は物理図問題で性能が低下

Ad
拡張思考モードにおけるパフォーマンスの問題
r/ClaudeAIのユーザーが、視覚的な図解の解釈を必要とする物理学の問題についてOpus 4.6とGemini 3.1 Proをテストしたと報告しました。このテストにより、拡張思考モードを使用した場合のOpus 4.6に特定のパフォーマンス低下が明らかになりました。
テストからの主な発見
- テスト範囲: 「問題の大部分がシナリオを示す視覚的な図解の解釈」である5つの物理学の問題
- 拡張思考モードを使用したOpus 4.6: 「図解の根本的な誤解により」5問すべてを「完全に間違えた」
- Gemini 3.1 Pro: 5問すべてを「完璧に解いた」
- 拡張思考モードを使用しないOpus 4.6: 問題を正常に解決し、「さらにずっと速かった」
ユーザーはこれを「本当に奇妙な動作」と表現しました。拡張思考モードは通常パフォーマンスを向上させますが、この特定の図解解釈の場合には一貫した失敗を引き起こしたからです。
📖 Read the full source: r/ClaudeAI
Ad
👀 See Also

News
クロードコードのソースコードが流出したと報じられ、エージェントのアーキテクチャ詳細が明らかになったとのことです。
AnthropicのAIコーディングエージェント「Claude Code」のソースコードが流出した模様で、システムプロンプト、エージェントループの実装、ツール呼び出しインフラを含む完全なリポジトリが含まれているとのことです。
OpenClawRadar

News
NTSBがスペクトログラムから死亡したパイロットの声をAIで再現した後、記録を撤回
CodexとGriffin-Limアルゴリズムを用いて、NTSBのスペクトログラムからコックピット音声を再現。NTSBはこれに対応して公開資料を一時閉鎖。
OpenClawRadar

News
Claude Opus 4.7がリリース、ハイブリッド推論と100万トークンのコンテキストウィンドウを搭載
Anthropicは、コーディング、視覚、複雑な多段階タスクにおいてより強力なパフォーマンスを発揮する、100万トークンのコンテキストウィンドウを持つハイブリッド推論モデル「Claude Opus 4.7」をリリースしました。価格は入力100万トークンあたり5ドル、出力100万トークンあたり25ドルからです。
OpenClawRadar

News
AWS BedrockがClaude Opus 4.7のクォータを密かに削減:本番AIワークフローへの警告
あるHNユーザーが、AWS Bedrockが警告なしにClaude Opus 4.7のクォータを0に設定したと報告。AWSサポートはシステム更新によるものと認め、復旧は保証できないとしている。ユーザーはOpus 4.6への移行またはプロバイダーの変更を推奨されている。
OpenClawRadar