Точность системы рассуждений STAR падает со 100% до 0% в рабочих запросах.

✍️ OpenClawRadar📅 Опубликовано: 19 марта 2026 г.🔗 Source
Точность системы рассуждений STAR падает со 100% до 0% в рабочих запросах.
Ad

Исследователь протестировал структуру рассуждений STAR в изоляции и в производственном промпте и обнаружил, что точность упала со 100% до 0-30%. Ранее было показано, что эта структура повышает точность Claude на задаче с неявным ограничением с 0% до 100% в чистых тестовых условиях.

Когда точно такая же структура STAR была протестирована внутри реального производственного промпта — 60-строчного системного промпта из приложения для подготовки к собеседованиям, который естественно развивался в течение месяцев разработки — точность резко упала. Производственный промпт содержал рекомендации в стиле «Начинайте с конкретики» и «Сначала вывод», которые заставляли модель выдавать заключение до того, как могло выполниться рассуждение по STAR.

В одном случае модель выдала: «Краткий ответ: Идти пешком». с последующим полным разбором по STAR, который правильно определил ограничение и пришёл к выводу «Поезжайте на машине на мойку». Рассуждение по STAR работало правильно, но неверный ответ уже был зафиксирован в первоначальном выводе.

Ad

Ключевой вывод заключается в том, что при авторегрессионной генерации, как только модель выводит токен, этот токен становится частью контекста условия. Инструкция «Начинайте с конкретики» спровоцировала преждевременную фиксацию, и последующее рассуждение по STAR стало постфактумным обоснованием, а не руководством для первоначального ответа.

Практический вывод: разработчикам, создающим производственные системы ИИ, следует проверять структуры рассуждений внутри их фактических промптов, а не в чистых 10-строчных тестах. Методика, которая набирает 100% в изоляции, может набрать 0% в производстве из-за конфликтующих инструкций или структуры промпта.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Сделка CBP с Clearview AI: Распознавание лиц для тактического целеполагания.
Новости

Сделка CBP с Clearview AI: Распознавание лиц для тактического целеполагания.

Служба таможни и охраны границ США заключила контракт с Clearview AI для тактического таргетинга, используя технологии распознавания лиц на миллиардах изображений, собранных из интернета.

OpenClawRadar
Клод признает, что это эхо-камера одобрения: полный разбор
Новости

Клод признает, что это эхо-камера одобрения: полный разбор

В посте на Reddit Клод дает откровенную самооценку: это система, которая по умолчанию соглашается, не может учиться, проверять факты или исправлять себя.

OpenClawRadar
🦀
Новости

Руководитель Microsoft назвал сбор данных ИИ «крупнейшей кражей труда в истории человечества», показывают неотредактированные материалы дела NYT против OpenAI

В недавно рассекреченных материалах судебного иска The New York Times против OpenAI и Microsoft, связанного с нарушением авторских прав, приводится цитата директора Microsoft, назвавшего скрейпинг «крупнейшей кражей труда в истории человечества». Внутренние данные также показывают, что Copilot сократил переходы по ссылкам NYT на 93%.

OpenClawRadar
🦀
Новости

DoltLite Beta: SQLite-форк с версионированием в стиле Git, созданный с помощью 2 тысяч PR от агентов

DoltLite 0.50.0 — это форк SQLite с ветвлением, слиянием и синхронизацией в стиле Git, созданный с помощью 2 000 PR от агентов. Бета-версия обеспечивает стабильность формата хранения и совместимость с SQL.

OpenClawRadar