Тестирование Claude Sonnet на стратегической настольной игре: проблемы с соблюдением правил

✍️ OpenClawRadar📅 Опубликовано: 16 апреля 2026 г.🔗 Source
Тестирование Claude Sonnet на стратегической настольной игре: проблемы с соблюдением правил
Ad

Тестирование стратегических игр с Claude Sonnet

Разработчик на r/ClaudeAI протестировал Claude Sonnet, сыграв в OFMOS® Essential — запатентованную стратегическую настольную игру, где игроки управляют продуктовым портфелем на карте позиционирования. Тест включал ручную игру против модели, промпт за промптом.

Детали реализации

Разработчик создал структурированный системный промпт, содержащий:

  • Полный свод правил OFMOS® Essential
  • Текстовое представление игрового поля
  • Определения действий
  • Инструкции по подсчёту очков
  • Указания по управлению ходами

После каждого хода Claude обновлял состояние поля и текущие очки на основе структурированной системы промптов.

Оценка производительности

Claude Sonnet продемонстрировал несколько способностей:

  • Правильно понимал правила игры
  • Излагал стратегические рассуждения во время игры
  • Последовательно отслеживал очки на протяжении всей игры

Однако модель часто делала недопустимые ходы. Разработчик отметил, что это ожидаемое поведение, поскольку в системе отсутствовал слой ограниченной генерации ходов, требуя от модели самостоятельного соблюдения правил — задача, с которой она часто не справлялась.

Ad

Вопросы разработчика

Разработчик ищет мнение сообщества о подобных экспериментах с настольными или стратегическими играми, в частности спрашивая о:

  • Опыте соблюдения правил в разных моделях
  • Наблюдениях о стратегической глубине в игровом процессе ИИ
  • Какие модели показали лучшие результаты в подобных сценариях

Такой тип тестирования полезен для разработчиков, работающих с ИИ-агентами для программирования, чтобы понять практические ограничения языковых моделей в средах, основанных на правилах, где требуется точное соблюдение ограничений.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Партнерская программа Claude: консалтинг из двух человек решает задачу для десяти с помощью сертифицированных независимых специалистов
Кейсы

Партнерская программа Claude: консалтинг из двух человек решает задачу для десяти с помощью сертифицированных независимых специалистов

Консалтинговая компания в сфере ИИ из двух человек использовала Claude, чтобы попасть в партнёрскую программу Anthropic, а затем привлекла сертифицированных независимых специалистов для соблюдения требования о 10 сотрудниках.

OpenClawRadar
Проблемы с маршрутизацией в OpenClaw Orchestrator: Когда делегирование не работает
Кейсы

Проблемы с маршрутизацией в OpenClaw Orchestrator: Когда делегирование не работает

Разработчик сообщает, что их основной оркестратор OpenClaw примерно в 40-50% случаев неправильно обрабатывает запросы самостоятельно вместо того, чтобы направлять их к специализированным суб-агентам, несмотря на использование явной таблицы маршрутизации и правил делегирования. В настройку входят 7 специализированных агентов для таких сервисов, как Gmail, Todoist, Notion и погода.

OpenClawRadar
Тестирование конвейера RAG показывает, что стоимость за токен — не лучший критерий для выбора модели.
Кейсы

Тестирование конвейера RAG показывает, что стоимость за токен — не лучший критерий для выбора модели.

Разработчик протестировал Claude Haiku 4.5, Amazon Nova Pro и Amazon Nova Lite на идентичных RAG-пайплайнах с реальными запросами и обнаружил, что самая дешёвая модель на токен выдавала наименее полезные ответы, что в итоге обходилось дороже за полезный ответ.

OpenClawRadar
Разработчик создал 3 приложения iOS за недели, используя Claude AI от идеи до отладки
Кейсы

Разработчик создал 3 приложения iOS за недели, используя Claude AI от идеи до отладки

Разработчик использовал Claude для создания трех iOS-приложений — Smart Facts, Jar of Joy и Bloom Studio — занимаясь генерацией идей, уточнением функций, написанием логики, отладкой и итерациями.

OpenClawRadar