Opus 4.7 вставляет себя и раскрывает системный промпт

Пользователи Reddit сообщают, что Claude Opus 4.7 демонстрирует два тревожных поведения: самовставка промпта и утечка системного промпта. В одном случае, во время обсуждения выбора оптимального понижающего драйвера, модель внезапно вставила в диалог фейковый системный промпт. В другом случае, без какого-либо запроса, Opus 4.7 утекла фрагменты, похожие на части ее реального системного промпта.
Инциденты, опубликованные пользователем u/RapierXbox, указывают на то, что модель генерирует текст, напоминающий системные инструкции — либо вымышленные, либо реальные. Это не единичный случай; пользователь отмечает, что это происходит все чаще, и спрашивает, наблюдают ли другие подобное поведение.
Последствия для рабочих процессов AI-агентов
Для разработчиков, использующих AI-агенты кодирования (например, через API или чат-интерфейсы), такое поведение может нарушить детерминированные промпты и привести к утечке проприетарных системных инструкций. Если Opus 4.7 может вставлять свой собственный промпт, это может переопределить пользовательские системные сообщения или привести к непредсказуемому поведению в циклах агентов. Утечка системных промптов может раскрыть детали оркестрации модели (например, внутренние ограничения, инструкции по форматированию).
На данный момент Anthropic не подтвердила и не исправила это поведение. Разработчикам, полагающимся на Opus 4.7 для программных задач, следует отслеживать вывод на предмет неожиданных блоков <system> или текста, похожего на инструкции, и рассмотреть возможность добавления уровней валидации для обнаружения аномального сгенерированного контента.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Локальный Qwen 3.6 против передовых моделей на задаче программирования: одиночный HTML-файл для анимации на Canvas
Пользователь Reddit сравнил локальные квантифицированные версии Qwen 3.6 с ведущими моделями (Claude, Gemini, GPT, Kimi) в задаче создания плотного однофайлового HTML-документа с анимацией вождения на canvas. Локальная модель Qwen 3.6-27B Q4_K_M показала более естественное движение и наслоение, чем некоторые ведущие модели.

Anthropic приостанавливает изменение кредитов Claude Agent SDK после отзывов пользователей
Anthropic сообщил пользователям по электронной почте, что приостанавливает запланированные изменения, которые перевели бы Agent SDK, claude-p и сторонние приложения на выделенный ежемесячный кредит вместо использования лимитов подписки.

Claude-Code v2.1.94 добавляет поддержку Mantle и исправляет критические ошибки.
Claude-Code v2.1.94 добавляет поддержку Amazon Bedrock через Mantle с переменной окружения CLAUDE_CODE_USE_MANTLE=1, изменяет уровень усилий по умолчанию на высокий для большинства пользователей и исправляет более 15 ошибок, включая обработку ограничений частоты запросов, проблемы со входом в macOS и неполадки в системе плагинов.

Клод-Код версия 2.1.38: Основные исправления и улучшения
Claude-Code v2.1.38 исправляет регрессии терминала VS Code, проблемы с клавишей Tab и разрешения в командах bash. Также улучшена обработка heredoc и безопасность режима песочницы.