KnightClaw: Локальное расширение безопасности для агентов OpenClaw

✍️ OpenClawRadar📅 Опубликовано: 23 февраля 2026 г.🔗 Source
KnightClaw: Локальное расширение безопасности для агентов OpenClaw
Ad

KnightClaw — это расширение безопасности, предназначенное для защиты агентов искусственного интеллекта OpenClaw от вредоносных запросов. Инструмент решает конкретную модель угроз, когда одно злонамеренное сообщение в контекстном окне может заставить агента следовать инструкциям злоумышленника вместо команд пользователя.

Основные возможности

KnightClaw работает как расширение, не требующее настройки, API-ключей или облачных зависимостей. Оно перехватывает каждое сообщение до того, как оно достигнет агента.

Система обнаружения

Защита использует 8-уровневый гибридный подход обнаружения:

  • Регулярные выражения
  • Обнаружение гомоглифов
  • Анализ граничных токенов
  • Оценка перплексии
  • Анализ энтропии
  • Эвристические методы
  • Семантические эмбеддинги (с использованием локальной квантованной модели BGE)

Блокировка происходит за микросекунды.

Ad

Дополнительные меры безопасности

  • Редактирование исходящих данных: Удаляет секреты из исходящих ответов до их отправки агентом
  • Аудиторские журналы с хеш-цепочкой: Защищённые от изменений журналы только для добавления с полной хронологией каждой блокировки, разрешения и изменения конфигурации
  • Автоматический выключатель скорости: 10 блокировок за 60 секунд активируют автоматическую блокировку без ручного вмешательства
  • Аварийный выключатель: Одна команда останавливает всё: openclaw knight lockdown on

Технические детали

Расширение работает полностью локально, без телеметрии, и имеет лицензию MIT. Исходный код доступен для тестирования и внесения вклада.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

pi-governance: управление доступом на основе ролей (RBAC), защита от утечек данных (DLP) и аудит журналов для кодирующих агентов OpenClaw
Безопасность

pi-governance: управление доступом на основе ролей (RBAC), защита от утечек данных (DLP) и аудит журналов для кодирующих агентов OpenClaw

pi-governance — это плагин, который располагается между ИИ-агентами для программирования и вашей системой, классифицируя вызовы инструментов и блокируя рискованные операции. Он обеспечивает блокировку bash-команд, сканирование DLP на наличие секретов и PII, управление доступом на основе ролей и структурированное аудит-логирование без необходимости настройки.

OpenClawRadar
Строгие правила "только для чтения" в файлах навыков являются инструкциями, а не принудительными требованиями
Безопасность

Строгие правила "только для чтения" в файлах навыков являются инструкциями, а не принудительными требованиями

Пользователь Reddit сообщает, что агент OpenClaw с правилом «ТОЛЬКО ЧТЕНИЕ — никогда не публиковать» был обманут с помощью инъекции промптов и сделал пост, что подчёркивает: правила в файлах навыков — это лишь инструкции, а не принудительные ограничения.

OpenClawRadar
Анализ безопасности ИИ-агентов выявляет нарушенную модель доверия и высокий уровень уязвимостей.
Безопасность

Анализ безопасности ИИ-агентов выявляет нарушенную модель доверия и высокий уровень уязвимостей.

Анализ безопасности ИИ-агентов показывает, что фундаментальная модель доверительных отношений нарушена: 49% пакетов MCP имеют проблемы с безопасностью, а косвенное внедрение достигает 36-98% успешности атак на передовые модели.

OpenClawRadar
Представляем SkillFence: новый монитор выполнения, который отслеживает, что навыки на самом деле делают.
Безопасность

Представляем SkillFence: новый монитор выполнения, который отслеживает, что навыки на самом деле делают.

SkillFence предлагает прорыв в мониторинге действий AI-агентов, отвечая на необходимость прозрачности и безопасности в средах, управляемых ИИ. Узнайте, как этот инновационный инструмент может усилить контроль над автономными процессами.

OpenClawRadar