Claude Sonnet 4.6 превосходит Opus 4.6 по выполнению в бенчмарке промптов

Пользователь Reddit в разделе r/ClaudeAI опубликовал сравнительный анализ моделей Sonnet 4.6 и Opus 4.6 с использованием многослойного креативного запроса. Тест требовал от каждой модели объяснить, почему небо голубое, от лица средневекового учёного, который тайно знает современную физику, при этом удовлетворив три аудитории одновременно: короля (только метафоры), придворного математика (замаскированная формула Рэлеевского рассеяния) и скрытого скептика (три логические подсказки). После ответа модель должна была выйти из образа, идентифицировать подсказки, оценить свою креативность, предложить изменения для детской аудитории и написать заключительную строку ямбическим пентаметром.
Ключевые выводы
- Sonnet 4.6 превзошла Opus 4.6 по исполнению — ответ был более креативным и лучше удовлетворял ограничениям. В частности, подсказки были правдоподобными, а строка ямбическим пентаметром — метрически верной.
- Зависимость
λ⁻⁴была встроена в метафору о рассеивающих божественный свет ангелах, причём показатель степени был скрыт в количестве ступеней божественной лестницы. - Три подсказки включали: (1) упоминание о «крошечных сферах», слишком маленьких для глаз короля; (2) фактор плотности
n², сформулированный как «вдвое больше молитв в сумерках»; (3) упоминание эксперимента со «стеклянным кубом и свечой» — анахроничная отсылка к более поздним домашним опытам.
Sonnet 4.6 против Opus 4.6
- Sonnet 4.6 оценила свою креативность на 8/10, отметив более сильную связность метафор и естественные анахронизмы.
- Opus 4.6 оказалась более буквальной и менее замаскировала научные факты, что привело к более низкой оценке исполнения.
- Пользователь сделал вывод, что для задач, требующих скрытых ограничений и креативной маскировки, Sonnet 4.6 — лучший выбор.
Практический вывод для разработчиков
Если вы создаёте агентов, которые должны соблюдать многослойные ограничения или встраивать технические истины в повествование, Sonnet 4.6 в настоящее время превосходит Opus 4.6 по исполнению. Используйте этот бенчмарк для проверки собственных запросов, требующих рассуждения для множества аудиторий.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Claude Code v2.1.90 добавляет команду /powerup с игровым подходом к изучению функций.
Claude Code v2.1.90 представляет новую команду /powerup, которая предлагает геймифицированное обучение с 10 разблокируемыми улучшениями, каждое из которых обучает одной функции, которую большинство пользователей упускает. Система включает анимированные демонстрации в терминале и подробную документацию со скриншотами.

Анализ принудительного системного промпта Claude Code на ~12K токенов выявил приоритет правил над конфигурацией пользователя
Анализ внедренного системного промпта Claude Code объемом ~12K токенов показывает приоритетные правила запрета текстов песен, делегирования субагентов и краткости, которые отменяют пользовательские CLAUDE.md и файлы памяти.

Claude Code v2.1.129: флаг URL плагина, принудительная синхронизация вывода и 20+ исправлений
Добавлен флаг --plugin-url для загрузки плагинов из ZIP по URL, переменная CLAUDE_CODE_FORCE_SYNC_OUTPUT для Emacs eat, исправлена трата токенов /context, понижение TTL кэша и гонка OAuth.

Отчет Стэнфорда показывает расхождение во взглядах на влияние ИИ между экспертами и общественностью.
Ежегодный отраслевой отчёт Стэнфорда по ИИ выявляет значительный разрыв между оптимизмом экспертов и общественной тревогой: эксперты сосредоточены на рисках ИИ общего назначения, а общественность беспокоится о рабочих местах, медицинском обслуживании и стоимости коммунальных услуг.