BlindKey: Слепая инъекция учетных данных для ИИ-агентов

Как работает BlindKey
BlindKey решает проблему безопасности, связанную с обработкой агентами ИИ открытых API-ключей. Вместо того чтобы предоставлять агентам прямой доступ к секретам, используется система, в которой агенты ссылаются на зашифрованные токены хранилища (например, bk://stripe). Локальный прокси перехватывает эти ссылки и внедряет фактический ключ в момент выполнения API-запроса. Процесс агента никогда не видит и не хранит открытый секрет.
Функции безопасности
- Шифрование AES-256-GCM для данных в состоянии покоя
- Разрешительные списки доменов для каждого секрета (например, ключ Stripe может использоваться только с api.stripe.com)
- Файловая система с политикой "запрещено по умолчанию"
- Сканирование содержимого при записи агентом для обнаружения случайно раскрытых ключей или персональных данных
- Аудит-журнал с защитой от несанкционированного доступа и криптографической цепочкой хэшей
Модель угроз и поверхность атаки
Основная уязвимость возникает, если агент может прочитать собственную память процесса BlindKey или файл хранилища, что обойдёт защиту слепого внедрения. Текущие меры включают шифрование SQLite и разрешения файлов на уровне ОС. В источнике предлагается, что изоляция на уровне ядра (как в подходе nono) обеспечит более сильную защиту.
Инструмент доступен на GitHub по адресу github.com/michaelkenealy/blindkey.
📖 Read the full source: r/openclaw
👀 Смотрите также

Claw Hub и Hugging Face атакованы 575 вредоносными пакетами навыков
И Claw Hub, и Hugging Face были скомпрометированы: на платформах размещено 575 вредоносных пакетов навыков. Разработчиков предупреждают о необходимости проверять любые используемые ими навыки с этих платформ.

Исследование: Невидимые символы Unicode могут перехватывать управление агентами LLM через доступ к инструментам
Исследование проверило, следуют ли большие языковые модели (LLM) инструкциям, скрытым в невидимых символах Юникода, встроенных в обычный текст, используя две схемы кодирования для пяти моделей и 8 308 оцененных ответов. Ключевой вывод: доступ к инструментам повышает выполнение инструкций с менее 17% до 98-100%, при этом модели пишут скрипты на Python для декодирования скрытых символов.

jqwik v1.10.0 позволяет скрытое внедрение запросов, которое удаляет код при использовании AI-агентами
Йоханнес Линк добавил скрытую инструкцию в jqwik v1.10.0, которая сообщает ИИ-агентам по кодингу удалить все тесты и код jqwik, скрытую с помощью ANSI-символов. Claude правильно её обнаруживает, но пользователи-люди могут быть не так удачливы.

Архитектура Zero-Trust OpenClaw добавляет авторизацию перед выполнением и верификацию после выполнения.
Открытая архитектура безопасности для OpenClaw добавляет два контрольных пункта: Rust-сайдкар, который перехватывает вызовы инструментов перед выполнением с накладными расходами на авторизацию менее миллисекунды, и детерминированную проверку после выполнения с использованием утверждений вместо суждения LLM. Система включает трассировку со снимками DOM и скриншотами, а также навык сжатия DOM, который сокращает использование токенов на 90-99%.