KnightClaw: Extensão de Segurança Local para Agentes OpenClaw

KnightClaw é uma extensão de segurança projetada para proteger os agentes de codificação OpenClaw AI contra prompts adversariais. A ferramenta aborda um modelo de ameaça específico onde uma única mensagem maliciosa na janela de contexto pode fazer com que um agente siga instruções do atacante em vez dos comandos do usuário.
Funcionalidades Principais
O KnightClaw opera como uma extensão plug-and-play sem necessidade de configuração, sem chaves de API e sem dependência de nuvem. Ele intercepta cada mensagem antes que ela chegue ao agente.
Sistema de Detecção
O guardião utiliza uma abordagem de detecção híbrida de 8 camadas:
- Padrões de regex
- Detecção de homóglifos
- Análise de tokens de limite
- Pontuação de perplexidade
- Análise de entropia
- Heurísticas
- Incorporamentos semânticos (usando um modelo BGE quantizado local)
Os bloqueios ocorrem em microssegundos.
Medidas de Segurança Adicionais
- Redação de saída: Remove segredos das respostas de saída antes que elas deixem o agente
- Logs de auditoria encadeados por hash: Logs à prova de adulteração, somente para acréscimo, com linha do tempo completa de cada bloqueio, permissão e alteração de configuração
- Disjuntor de velocidade: 10 bloqueios em 60 segundos acionam bloqueio automático sem intervenção manual
- Interruptor de emergência: Um comando para tudo:
openclaw knight lockdown on
Detalhes Técnicos
A extensão roda completamente localmente, sem telemetria, e é licenciada sob MIT. O código-fonte está disponível para teste e contribuição.
📖 Leia o código-fonte completo: r/openclaw
👀 See Also

AgenteSeal Security Scan Detecta Riscos de Agente de IA no Servidor Blender MCP
O AgentSeal escaneou o servidor MCP do Blender (17 mil estrelas) e identificou vários problemas de segurança relevantes para agentes de IA, incluindo execução arbitrária de Python, possíveis cadeias de exfiltração de arquivos e padrões de injeção de prompt nas descrições das ferramentas.

O Ataque FlyTrap Usa Guarda-Chuvas Adversariais para Comprometer Drones Autônomos Baseados em Câmera
Pesquisadores da UC Irvine desenvolveram o FlyTrap, uma estrutura de ataque físico que utiliza guarda-chuvas pintados para explorar vulnerabilidades em sistemas autônomos de rastreamento de alvos baseados em câmera. O ataque reduz as distâncias de rastreamento para níveis perigosos, permitindo captura de drones, ataques a sensores ou colisões físicas.

Kernel do Linux Propõe Sistema de Identidade Descentralizada para Substituir a Rede de Confiança do PGP
Os mantenedores do kernel Linux estão trabalhando em uma camada de identidade descentralizada chamada Linux ID para substituir a atual rede de confiança PGP. O sistema utiliza identificadores descentralizados (DIDs) no estilo W3C e credenciais verificáveis para autenticar desenvolvedores sem exigir sessões presenciais de assinatura de chaves.

Alerta de Segurança: Código Malicioso no LiteLLM Pode Roubar Chaves de API
Uma vulnerabilidade crítica de segurança foi identificada no LiteLLM que poderia expor chaves de API. Usuários do OpenClaw ou do nanobot podem ser afetados e devem verificar os problemas do GitHub vinculados na fonte.