Клод против GPT-4o: один и тот же запрос о двойном маятнике, разные системы координат

Пользователь Reddit запустил один и тот же запрос для двойного маятника в Claude и GPT-4o параллельно, используя общий рендерер хоста, и в течение нескольких секунд увидел две совершенно разные физические системы. Причина: каждая модель выбрала разное соглашение для измерения угла θ.
Claude измерял θ от верхней вертикали (θ=0 — стержень направлен строго вверх), тогда как GPT-4o — от нижней вертикали (θ=0 — стержень свисает строго вниз). Рендерер хоста в public/workers/simulator-host.js просто считывает info.theta1 и info.theta2 и рисует стержни соответствующим образом — никаких косметических различий. Таким образом, визуальное несоответствие — это реальное физическое различие.
Оба соглашения технически допустимы. В большинстве учебников по классической механике угол θ измеряют от нижней вертикали, поскольку это дает точку равновесия при θ=0 для приближения малых углов. Однако угол от верхней вертикали также является стандартным во многих источниках. Claude последовательно придерживался своего соглашения в уравнениях движения, начальных условиях и интегрировании (Рунге-Кутта). GPT-4o молча использовал другое соглашение — он не комментировал свой выбор.
Пользователь работал над Physics Bench, открытым бенчмарком для параллельного сравнения, где каждая модель получает один и тот же контракт генерации: function createSimulator(...) в lib/prompt.ts. Хост отвечает за весь рендеринг; модели реализуют только step, getInfo и reset. Модели никогда не трогают draw. Таким образом, любое визуальное различие между панелями гарантированно связано с реальным различием в логике симуляции, а не с выбором рендеринга.
Модульный тест математики не позволил бы выявить это. Обе модели дают корректную физику для выбранных ими соглашений. Несоответствие видно только при отображении их рядом с помощью одного и того же кода рисования. Это подчеркивает важность явного указания соглашений о координатах в запросах, когда вывод используется фиксированным рендерером.
Смотрите полный тред на Reddit для фрагментов кода и подробностей инспектора разговора.
📖 Прочитать полный источник: r/ClaudeAI
👀 Смотрите также

Nemotron 3 4B уступает Qwen 3.5 4B в сложных тестах производительности.
Пользователь Reddit протестировал Nemotron 3 4B Q8 против Qwen 3.5 4B Q8 на сложных математических и программистских задачах, обнаружив, что Nemotron не смог предоставить корректные рассуждения и структурированный вывод, в то время как Qwen успешно прошел все тесты.

Сопровождающий ядра Linux сообщает о внезапном улучшении качества отчётов об ошибках, созданных искусственным интеллектом.
Грег Кроа-Хартман заявляет, что AI-сгенерированные отчёты об ошибках для ядра Linux перешли от 'AI-помоев' к легитимным отчётам примерно месяц назад, причём команды безопасности с открытым исходным кодом в различных проектах наблюдают аналогичный сдвиг. Команда ядра справляется с увеличением нагрузки с помощью инструментов вроде Sashiko для автоматизации проверок.

Утечка чата Claude через поиск Google: что нужно знать разработчикам
За выходные ссылки для обмена Claude AI были проиндексированы Google, что раскрыло приватные чаты, включая юридические стратегии и технические обсуждения. Anthropic заблокировал поисковый запрос. Это второй подобный инцидент.

Модель искусственного интеллекта Google Gemini Nano в Chrome занимает 4 ГБ дискового пространства
Google Chrome автоматически загружает 4-гигабайтный файл weights.bin для встроенной модели ИИ Gemini Nano, что может раздуть хранилище без четкого уведомления пользователя. Отключение переключателя On-Device AI в настройках удаляет файл и предотвращает повторную загрузку.