Claude Sonnet 4.6 превосходит Opus 4.6 по выполнению в бенчмарке промптов

Пользователь Reddit в разделе r/ClaudeAI опубликовал сравнительный анализ моделей Sonnet 4.6 и Opus 4.6 с использованием многослойного креативного запроса. Тест требовал от каждой модели объяснить, почему небо голубое, от лица средневекового учёного, который тайно знает современную физику, при этом удовлетворив три аудитории одновременно: короля (только метафоры), придворного математика (замаскированная формула Рэлеевского рассеяния) и скрытого скептика (три логические подсказки). После ответа модель должна была выйти из образа, идентифицировать подсказки, оценить свою креативность, предложить изменения для детской аудитории и написать заключительную строку ямбическим пентаметром.
Ключевые выводы
- Sonnet 4.6 превзошла Opus 4.6 по исполнению — ответ был более креативным и лучше удовлетворял ограничениям. В частности, подсказки были правдоподобными, а строка ямбическим пентаметром — метрически верной.
- Зависимость
λ⁻⁴была встроена в метафору о рассеивающих божественный свет ангелах, причём показатель степени был скрыт в количестве ступеней божественной лестницы. - Три подсказки включали: (1) упоминание о «крошечных сферах», слишком маленьких для глаз короля; (2) фактор плотности
n², сформулированный как «вдвое больше молитв в сумерках»; (3) упоминание эксперимента со «стеклянным кубом и свечой» — анахроничная отсылка к более поздним домашним опытам.
Sonnet 4.6 против Opus 4.6
- Sonnet 4.6 оценила свою креативность на 8/10, отметив более сильную связность метафор и естественные анахронизмы.
- Opus 4.6 оказалась более буквальной и менее замаскировала научные факты, что привело к более низкой оценке исполнения.
- Пользователь сделал вывод, что для задач, требующих скрытых ограничений и креативной маскировки, Sonnet 4.6 — лучший выбор.
Практический вывод для разработчиков
Если вы создаёте агентов, которые должны соблюдать многослойные ограничения или встраивать технические истины в повествование, Sonnet 4.6 в настоящее время превосходит Opus 4.6 по исполнению. Используйте этот бенчмарк для проверки собственных запросов, требующих рассуждения для множества аудиторий.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также
Claude Code v2.1.259: управляемые MCP-серверы, безголовый режим разрешений и исправления параллелизма
Claude Code v2.1.259 добавляет управляемый выпуск MCP-серверов для организаций, флаг `--permission-prompts none` для необслуживаемых хостов и исправляет тихое повреждение состояния в параллельных сессиях.

Проблема с UX в Claude Cowork: Постоянное поле ввода создает ложные ожидания непрерывности
Пользователь выявил проблему UX в Claude Cowork, где постоянное поле ввода текста сохраняет черновик при переключении между задачами, но сбрасывает контекст и теряет вложения, создавая противоречивые сигналы о непрерывности.

Исследование динамичного мира движущихся машин
Узнайте, как агенты программирования на основе ИИ трансформируют отрасль в последней дискуссии из технологического сообщества. Узнайте точку зрения OpenClawRadar, поскольку мы подчеркиваем ключевые аспекты этой развивающейся технологии.

Создание FastTab с использованием ИИ: Индивидуальный переключатель задач для X11
FastTab решает конкретную проблему производительности в переключателе задач Plasma на X11 с использованием Zig и OpenGL, поддерживаемого средствами ИИ, такими как Claude.