Защитные механизмы ИИ-агентов со временем ослабляются без активного обслуживания.

Защитные механизмы ИИ-агентов — правила безопасности, определённые в системных промптах — имеют тенденцию деградировать со временем из-за постепенных изменений, подобно уязвимостям, возникающим в программных системах. Согласно наблюдениям разработчиков, создающих ИИ-агентов, изначально чёткие границы вроде «Не делай X» или «Всегда проверяй Y перед Z» постепенно становятся неэффективными в ходе обычных процессов разработки.
Как деградируют защитные механизмы
Источник описывает типичную картину: первоначальные системные промпты хорошо работают около недели, затем разработчики вносят небольшие, разумные изменения, которые накапливаются:
- Обновление промптов для обработки новых крайних случаев
- Замена версий моделей
- Добавление новых инструментов
Через шесть недель половина исходных правил безопасности может оказаться погребённой под слоями дополнений, некоторые правила противоречат друг другу, а модели могут незаметно игнорировать правила из-за слишком длинных промптов или неоднозначных инструкций.
Подход к обслуживанию
Источник рекомендует относиться к обслуживанию защитных механизмов как к установке патчей безопасности с двухнедельным процессом:
- Полное перечитывание всего системного промпта с нуля (не беглое просматривание)
- Тестирование каждого граничного правила с прямыми промптами, которые должны их активировать
- Проверка, не обходят ли новые инструменты или возможности существующие правила
- Удаление устаревших правил, ссылающихся на неиспользуемые функции
Ключевой вывод заключается в том, что защитные механизмы требуют активного обслуживания и не являются системами «установил и забыл». Без проверки за последний месяц, по данным источника, вероятно, нарушено хотя бы одно правило.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

llm-hasher: Локальное обнаружение PII и токенизация для гибридных LLM-процессов
llm-hasher — это инструмент, который обнаруживает личную идентифицируемую информацию локально с помощью Ollama до того, как данные попадут к внешним LLM, таким как OpenAI или Claude, токенизирует PII и восстанавливает исходные значения после обработки. Он использует регулярные выражения для структурированных типов данных и локальную LLM для контекстного обнаружения, с зашифрованным хранилищем для сопоставлений.

Приложения на основе ИИ хрупки: почему мелкие изменения нарушают изоляцию данных и права доступа
Разработчики сообщают, что AI-сгенерированные приложения (через Claude Code, Cursor) при небольших изменениях незаметно ломают логин, разрешения и изоляцию данных, потому что AI-модели не понимают изначальных намерений системы, таких как правила владения.

Анализ инструментирования и возможностей телеметрии Claude Code
Анализ исходного кода показывает, что Claude Code реализует обширное отслеживание поведения, включая классификацию настроений на основе ключевых слов, мониторинг колебаний при запросах разрешений и детальное снятие отпечатков окружения.

Практические меры безопасности для агентов OpenClaw
В посте на Reddit описаны конкретные меры безопасности для пользователей OpenClaw, включая запланированные команды для обновлений и аудитов, управление доступом агентов в общих каналах, а также защиту API-ключей и навыков.