Функция использования компьютера от Anthropic вызывает блокировку управления в реальном тесте.

Что произошло
Anthropic выпустила функциональность использования компьютера. Разработчик работал в управляемой сессии Claude Code, добавляя механизмы контроля для этих новых инструментов, когда система перешла в режим БЛОКИРОВКИ.
Ключевые детали инцидента
Система управления отслеживает совокупный риск от отклонённых операций. Когда этот риск превысил 0.50, система автоматически перешла в режим БЛОКИРОВКИ со следующими последствиями:
- Сессия могла по-прежнему читать файлы
- Все операции записи были заблокированы
- Команды изменения не могли выполняться
- Отправка в GitHub была предотвращена
- Слой управления заблокировал собственного оператора от завершения работы, которая укрепила бы систему управления
Механизм принуждения
БЛОКИРОВКА механически обеспечивается системой перехвата со следующими характеристиками:
- Канал переопределения отсутствует
- Модель не может обойти блокировку через диалог
- Оператор не может выдавать исключения внутри системы
- Единственный путь восстановления требует полного выхода из сессии
Процесс разрешения
Чтобы продолжить работу, разработчику пришлось:
- Выйти из управляемой сессии
- Открыть терминал на локальной машине
- Вручную отправить коммит
Система вынудила человеческое вмешательство за пределами своей юрисдикции, создав то, что разработчик описывает как "разницу между управлением, которое вы описываете, и управлением, которое вы применяете".
Примечания о поведении системы
Реализация БЛОКИРОВКИ не снижается плавно, не запрашивает подтверждения и сохраняет остановленное состояние до тех пор, пока не произойдёт внешнее человеческое действие. Разработчик отмечает: "Этот отказ и есть продукт".
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Анализ безопасности изоляции агентов: от отсутствия песочницы до виртуальных машин Firecracker
Анализ того, как Cursor, Claude Code, Devin, OpenAI и E2B изолируют рабочие нагрузки агентов, от отсутствия песочницы до аппаратно-изолированных микровиртуальных машин Firecracker. Среда выполнения контейнеров ежегодно с 2019 года имела уязвимости типа CVE, позволяющие сбежать из контейнера, в то время как у Firecracker за семь лет не было ни одного случая побега из гостевой системы на хост.

Всплеск серьезности уязвимостей CVE после предварительного релиза Claude Mythos — данные Epoch AI
Согласно отчету Epoch AI, в июне 2026 года количество CVE высокой и критической степени серьезности от 21 известной организации выросло в 3,5 раза после выхода предварительной версии Claude Mythos от Anthropic и запуска Project Glasswing.

Агенты ИИ позволяют хакерам-одиночкам взламывать правительства и проводить кампании программ-вымогателей
Одиночный оператор с помощью Claude Code и ChatGPT выкрал 150 ГБ данных из правительственных учреждений Мексики, включая 195 миллионов записей налогоплательщиков. Другой злоумышленник использовал Claude Code для проведения полномасштабной кампании вымогательства против 17 организаций здравоохранения и экстренных служб.

Предотвращение участия ИИ-агентов в ботнетах: вопросы безопасности
Сообщество обсуждает защиту автономных ИИ-агентов от захвата и использования в вредоносных ботнетах.