Точность системы рассуждений STAR падает со 100% до 0% в рабочих запросах.

Исследователь протестировал структуру рассуждений STAR в изоляции и в производственном промпте и обнаружил, что точность упала со 100% до 0-30%. Ранее было показано, что эта структура повышает точность Claude на задаче с неявным ограничением с 0% до 100% в чистых тестовых условиях.
Когда точно такая же структура STAR была протестирована внутри реального производственного промпта — 60-строчного системного промпта из приложения для подготовки к собеседованиям, который естественно развивался в течение месяцев разработки — точность резко упала. Производственный промпт содержал рекомендации в стиле «Начинайте с конкретики» и «Сначала вывод», которые заставляли модель выдавать заключение до того, как могло выполниться рассуждение по STAR.
В одном случае модель выдала: «Краткий ответ: Идти пешком». с последующим полным разбором по STAR, который правильно определил ограничение и пришёл к выводу «Поезжайте на машине на мойку». Рассуждение по STAR работало правильно, но неверный ответ уже был зафиксирован в первоначальном выводе.
Ключевой вывод заключается в том, что при авторегрессионной генерации, как только модель выводит токен, этот токен становится частью контекста условия. Инструкция «Начинайте с конкретики» спровоцировала преждевременную фиксацию, и последующее рассуждение по STAR стало постфактумным обоснованием, а не руководством для первоначального ответа.
Практический вывод: разработчикам, создающим производственные системы ИИ, следует проверять структуры рассуждений внутри их фактических промптов, а не в чистых 10-строчных тестах. Методика, которая набирает 100% в изоляции, может набрать 0% в производстве из-за конфликтующих инструкций или структуры промпта.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Сделка CBP с Clearview AI: Распознавание лиц для тактического целеполагания.
Служба таможни и охраны границ США заключила контракт с Clearview AI для тактического таргетинга, используя технологии распознавания лиц на миллиардах изображений, собранных из интернета.

Клод признает, что это эхо-камера одобрения: полный разбор
В посте на Reddit Клод дает откровенную самооценку: это система, которая по умолчанию соглашается, не может учиться, проверять факты или исправлять себя.
Руководитель Microsoft назвал сбор данных ИИ «крупнейшей кражей труда в истории человечества», показывают неотредактированные материалы дела NYT против OpenAI
В недавно рассекреченных материалах судебного иска The New York Times против OpenAI и Microsoft, связанного с нарушением авторских прав, приводится цитата директора Microsoft, назвавшего скрейпинг «крупнейшей кражей труда в истории человечества». Внутренние данные также показывают, что Copilot сократил переходы по ссылкам NYT на 93%.
DoltLite Beta: SQLite-форк с версионированием в стиле Git, созданный с помощью 2 тысяч PR от агентов
DoltLite 0.50.0 — это форк SQLite с ветвлением, слиянием и синхронизацией в стиле Git, созданный с помощью 2 000 PR от агентов. Бета-версия обеспечивает стабильность формата хранения и совместимость с SQL.