Точность системы рассуждений STAR падает со 100% до 0% в рабочих запросах.

Исследователь протестировал структуру рассуждений STAR в изоляции и в производственном промпте и обнаружил, что точность упала со 100% до 0-30%. Ранее было показано, что эта структура повышает точность Claude на задаче с неявным ограничением с 0% до 100% в чистых тестовых условиях.
Когда точно такая же структура STAR была протестирована внутри реального производственного промпта — 60-строчного системного промпта из приложения для подготовки к собеседованиям, который естественно развивался в течение месяцев разработки — точность резко упала. Производственный промпт содержал рекомендации в стиле «Начинайте с конкретики» и «Сначала вывод», которые заставляли модель выдавать заключение до того, как могло выполниться рассуждение по STAR.
В одном случае модель выдала: «Краткий ответ: Идти пешком». с последующим полным разбором по STAR, который правильно определил ограничение и пришёл к выводу «Поезжайте на машине на мойку». Рассуждение по STAR работало правильно, но неверный ответ уже был зафиксирован в первоначальном выводе.
Ключевой вывод заключается в том, что при авторегрессионной генерации, как только модель выводит токен, этот токен становится частью контекста условия. Инструкция «Начинайте с конкретики» спровоцировала преждевременную фиксацию, и последующее рассуждение по STAR стало постфактумным обоснованием, а не руководством для первоначального ответа.
Практический вывод: разработчикам, создающим производственные системы ИИ, следует проверять структуры рассуждений внутри их фактических промптов, а не в чистых 10-строчных тестах. Методика, которая набирает 100% в изоляции, может набрать 0% в производстве из-за конфликтующих инструкций или структуры промпта.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Взгляды разработчиков на тревогу, связанную с ИИ, и «психоз ИИ»
Обсуждение на Reddit выявило широко распространенную тревогу среди разработчиков, использующих инструменты ИИ, причем разные возрастные группы испытывают различные виды давления: 35-45-летние чувствуют постоянное давление необходимости переизобретать себя, 25-35-летние беспокоятся, что их навыки устаревают, а разработчики младше 25 лет сталкиваются с рисками выгорания, несмотря на свободное владение ИИ.

Anthropic разъясняет политику использования CLI Claude для интеграции с OpenClaw
Anthropic подтвердила, что использование Claude CLI в стиле OpenClaw снова разрешено, что позволяет разработчикам напрямую повторно использовать существующие логины Claude CLI. В документации подробно описаны методы аутентификации как по API-ключу, так и через CLI, а также параметры конфигурации для моделей Claude 4.6, быстрого режима и кэширования промптов.

Claude Code v2.1.89 добавляет отложенные хуки, повторную попытку разрешений и устраняет утечки памяти.
Claude Code v2.1.89 представляет разрешение 'defer' для хуков PreToolUse, добавляет хук PermissionDenied с возможностью повторной попытки и исправляет критические проблемы, включая утечки памяти при больших JSON-вводах и сбои кэша схем StructuredOutput.

Gemma 4: Ранние признаки. Упор на практическое внедрение, а не на хайп, для локальных рабочих процессов с агентами.
Запуск Gemma 4 подчеркивает развертывание на различных уровнях аппаратного обеспечения с официальной позицией для персонального оборудования и периферийных/мобильных устройств, квантование NVIDIA NVFP4 демонстрирует 4-кратное сжатие с сохранением 99,7% базовых показателей на GPQA, а рейтинги Arena помещают плотную модель 31B примерно на 27-е место.