KnightClaw: Локальное расширение безопасности для агентов OpenClaw

KnightClaw — это расширение безопасности, предназначенное для защиты агентов искусственного интеллекта OpenClaw от вредоносных запросов. Инструмент решает конкретную модель угроз, когда одно злонамеренное сообщение в контекстном окне может заставить агента следовать инструкциям злоумышленника вместо команд пользователя.
Основные возможности
KnightClaw работает как расширение, не требующее настройки, API-ключей или облачных зависимостей. Оно перехватывает каждое сообщение до того, как оно достигнет агента.
Система обнаружения
Защита использует 8-уровневый гибридный подход обнаружения:
- Регулярные выражения
- Обнаружение гомоглифов
- Анализ граничных токенов
- Оценка перплексии
- Анализ энтропии
- Эвристические методы
- Семантические эмбеддинги (с использованием локальной квантованной модели BGE)
Блокировка происходит за микросекунды.
Дополнительные меры безопасности
- Редактирование исходящих данных: Удаляет секреты из исходящих ответов до их отправки агентом
- Аудиторские журналы с хеш-цепочкой: Защищённые от изменений журналы только для добавления с полной хронологией каждой блокировки, разрешения и изменения конфигурации
- Автоматический выключатель скорости: 10 блокировок за 60 секунд активируют автоматическую блокировку без ручного вмешательства
- Аварийный выключатель: Одна команда останавливает всё:
openclaw knight lockdown on
Технические детали
Расширение работает полностью локально, без телеметрии, и имеет лицензию MIT. Исходный код доступен для тестирования и внесения вклада.
📖 Read the full source: r/openclaw
👀 Смотрите также

VulnHunter: Инструмент агентного ИИ для безопасности кода от Capital One теперь с открытым исходным кодом
Capital One открыл исходный код VulnHunter — агентного ИИ-инструмента, который моделирует точки входа атакующих, опровергает находки для снижения ложных срабатываний и генерирует целевые исправления кода.

Пользователь OpenClaw добавляет TOTP 2FA после того, как агент оставил API-ключи в открытом тексте.
Пользователь OpenClaw создал навык безопасности под названием 'Secure Reveal', который требует аутентификации по TOTP через Telegram перед отображением сохранённых учётных данных, после того как их ИИ-агент случайно раскрыл API-ключи и пароли в открытом тексте во время демонстрации.

Сандер: Локальный фаервол конфиденциальности на основе Rust для LLM.
Sunder — это расширение для Chrome, которое действует как локальный прививочный экран конфиденциальности для AI-чатов, созданное с использованием Rust и WebAssembly, гарантируя, что конфиденциальные данные никогда не покинут ваш браузер.

Исследователи в области ИИ-безопасности: ваши уязвимости нулевого дня могут быть раскрыты через функцию согласия на передачу данных
Переключатель 'Улучшить модель для всех' в интерфейсах LLM может автоматически собирать глубокие исследования red-teaming, отправляя ваши концепции уязвимостей командам безопасности поставщиков и потенциально в академические статьи до вашей публикации. Отключите обмен данными перед проведением серьёзных исследований безопасности.