Claude vs GPT-4o: 同一の二重振り子プロンプト、異なる座標系の慣例

あるRedditユーザーが、共有ホストレンダラーを使用してClaudeとGPT-4oに同じ二重振り子のプロンプトを実行したところ、数秒のうちに2つのまったく異なる物理システムが表示されました。原因は、各モデルがθの測定に異なる規約を選択したことです。
Claudeは上向き垂直線からthetaを測定しました(theta=0 = 腕が真上を指す)。一方、GPT-4oは下向き垂直線から測定しました(theta=0 = 腕が真下に垂れる)。ホストレンダラー(public/workers/simulator-host.js)は単にinfo.theta1とinfo.theta2を読み取り、それに従って腕を描画するだけです。見た目の違いはありません。したがって、視覚的な不一致は実際の物理の不一致です。
両方の規約は技術的に有効です。ほとんどの古典力学の教科書では、下向き垂直線からのθを使用します。これは、小角度近似において平衡点がtheta=0になるためです。しかし、上向き垂直線からのθも多くの参考文献で標準的に使用されています。Claudeは運動方程式、初期条件、積分(Runge Kutta)にわたって一貫してその規約を守りました。GPT-4oは、その選択についてコメントすることなく、黙って別の規約を使用しました。
ユーザーはPhysics Benchに取り組んでいました。これはオープンソースの並列ベンチマークで、すべてのモデルに同じ生成契約(function createSimulator(...) in lib/prompt.ts)が与えられます。ホストがすべてのレンダリングを担当し、モデルはstep、getInfo、resetのみを実装します。モデルはdrawに触れることはありません。したがって、パネル間の視覚的な違いはすべて、レンダリングの選択ではなく、シミュレーションロジックの実際の違いに起因することが保証されています。
数学の単体テストではこれを見つけられなかったでしょう。両方のモデルは、それぞれの選択した規約に対して正しい物理を生成します。同じ描画コードを通して並べてレンダリングしたときに初めて、その違いが明らかになります。これは、出力が固定レンダラーで消費される場合、プロンプトで座標規約を明示的に指定することの重要性を強調しています。
コードスニペットと会話インスペクターの詳細については、完全なRedditスレッドを参照してください。
📖 Read the full source: r/ClaudeAI
👀 See Also

OpenClaw 2026.3.11リリースでは、ローカルファーストのOllamaセットアップ、統合されたOpenCodeキー、およびマルチモーダルメモリが追加されました。
OpenClaw 2026.3.11では、ローカル専用またはハイブリッドモードによるファーストクラスのOllamaセットアップ、ZenとGoモデルのための統一されたOpenCodeキー管理、Gemini埋め込みを用いたマルチモーダル画像/音声インデックス化を導入します。

ÅngstromがClaude Codeを使用してMetaのUMA-OMCを凌ぐモデルを訓練 — スポット上で10万GPUジョブ
Ångstrom(YC S24)がCSP-MACE-Åを訓練し、DFTの10,000倍の速度で同等の精度を達成、結晶構造予測でMetaのUMA-OMCを上回りました。Claude Codeを使用してAnycloud CLI経由で10万件のGPUジョブをマルチクラウドスポットで調整しました。

Mistral AIがEmmi AIを買収し、産業エンジニアリングAIスタックを構築
Mistral AIがEmmi AIを買収。物理系AIモデルを統合し、エネルギー、自動車、半導体、航空宇宙向けの産業シミュレーションを実現。30名以上の研究者チームが参加し、リンツに新オフィスを開設。

ローカルLLMベンチマーク:関数呼び出しによるバックエンド生成 – GLM、Qwen、DeepSeekの比較
関数呼び出しによるバックエンドコード生成におけるローカルLLMとフロンティアLLMの厳格なベンチマークと採点基準。主な発見: qwen3.5-35b-a3bはDB/API設計でgpt-5.4に匹敵し、高密度Qwen 27Bは397B MoEを上回る。フロンティアモデルはコストのため除外。