Claude Sonnet 4.6 превосходит Opus 4.6 по выполнению в бенчмарке промптов

✍️ OpenClawRadar📅 Опубликовано: 17 мая 2026 г.🔗 Source
Claude Sonnet 4.6 превосходит Opus 4.6 по выполнению в бенчмарке промптов
Ad

Пользователь Reddit в разделе r/ClaudeAI опубликовал сравнительный анализ моделей Sonnet 4.6 и Opus 4.6 с использованием многослойного креативного запроса. Тест требовал от каждой модели объяснить, почему небо голубое, от лица средневекового учёного, который тайно знает современную физику, при этом удовлетворив три аудитории одновременно: короля (только метафоры), придворного математика (замаскированная формула Рэлеевского рассеяния) и скрытого скептика (три логические подсказки). После ответа модель должна была выйти из образа, идентифицировать подсказки, оценить свою креативность, предложить изменения для детской аудитории и написать заключительную строку ямбическим пентаметром.

Ключевые выводы

  • Sonnet 4.6 превзошла Opus 4.6 по исполнению — ответ был более креативным и лучше удовлетворял ограничениям. В частности, подсказки были правдоподобными, а строка ямбическим пентаметром — метрически верной.
  • Зависимость λ⁻⁴ была встроена в метафору о рассеивающих божественный свет ангелах, причём показатель степени был скрыт в количестве ступеней божественной лестницы.
  • Три подсказки включали: (1) упоминание о «крошечных сферах», слишком маленьких для глаз короля; (2) фактор плотности n², сформулированный как «вдвое больше молитв в сумерках»; (3) упоминание эксперимента со «стеклянным кубом и свечой» — анахроничная отсылка к более поздним домашним опытам.
Ad

Sonnet 4.6 против Opus 4.6

  • Sonnet 4.6 оценила свою креативность на 8/10, отметив более сильную связность метафор и естественные анахронизмы.
  • Opus 4.6 оказалась более буквальной и менее замаскировала научные факты, что привело к более низкой оценке исполнения.
  • Пользователь сделал вывод, что для задач, требующих скрытых ограничений и креативной маскировки, Sonnet 4.6 — лучший выбор.

Практический вывод для разработчиков

Если вы создаёте агентов, которые должны соблюдать многослойные ограничения или встраивать технические истины в повествование, Sonnet 4.6 в настоящее время превосходит Opus 4.6 по исполнению. Используйте этот бенчмарк для проверки собственных запросов, требующих рассуждения для множества аудиторий.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

🦀
Новости

Claude Code v2.1.259: управляемые MCP-серверы, безголовый режим разрешений и исправления параллелизма

Claude Code v2.1.259 добавляет управляемый выпуск MCP-серверов для организаций, флаг `--permission-prompts none` для необслуживаемых хостов и исправляет тихое повреждение состояния в параллельных сессиях.

OpenClawRadar
Проблема с UX в Claude Cowork: Постоянное поле ввода создает ложные ожидания непрерывности
Новости

Проблема с UX в Claude Cowork: Постоянное поле ввода создает ложные ожидания непрерывности

Пользователь выявил проблему UX в Claude Cowork, где постоянное поле ввода текста сохраняет черновик при переключении между задачами, но сбрасывает контекст и теряет вложения, создавая противоречивые сигналы о непрерывности.

OpenClawRadar
Исследование динамичного мира движущихся машин
Новости

Исследование динамичного мира движущихся машин

Узнайте, как агенты программирования на основе ИИ трансформируют отрасль в последней дискуссии из технологического сообщества. Узнайте точку зрения OpenClawRadar, поскольку мы подчеркиваем ключевые аспекты этой развивающейся технологии.

OpenClawRadar
Создание FastTab с использованием ИИ: Индивидуальный переключатель задач для X11
Новости

Создание FastTab с использованием ИИ: Индивидуальный переключатель задач для X11

FastTab решает конкретную проблему производительности в переключателе задач Plasma на X11 с использованием Zig и OpenGL, поддерживаемого средствами ИИ, такими как Claude.

OpenClawRadar