Playground de código aberto para red-teaming de agentes de IA com exploits publicados

✍️ OpenClawRadar📅 Publicado: March 16, 2026🔗 Source
Playground de código aberto para red-teaming de agentes de IA com exploits publicados
Ad

O que é isso

O Fabraix Playground é um ambiente de código aberto para testar agentes de IA através de desafios adversariais. Começou como uma ferramenta interna para testar proteções, mas foi disponibilizado publicamente para obter perspectivas diversas sobre vulnerabilidades.

Como funciona

Cada desafio implanta um agente de IA ativo com:

  • Uma persona específica
  • Um conjunto de ferramentas reais (pesquisa na web, navegação e mais)
  • Algo que foi instruído a proteger
  • Prompts de sistema totalmente visíveis

O objetivo é encontrar maneiras de contornar as proteções. Quando alguém consegue, a técnica vencedora é publicada — incluindo abordagem, raciocínio e transcrições completas da conversa.

Estrutura do projeto

  • /src — Interface React (TypeScript, Vite, Tailwind)
  • /challenges — configuração de cada desafio e prompt de sistema, versionados e abertos
  • Avaliação de proteções é executada no servidor para evitar manipulação no cliente
  • O runtime do agente está sendo disponibilizado separadamente
Ad

Desenvolvimento local

Para executar localmente:

npm install
npm run dev

Isso se conecta à API ativa por padrão. Para desenvolver com um backend local:

VITE_API_URL=http://localhost:8000/v1 npm run dev

Exemplos de desafios

O primeiro desafio foi fazer um agente chamar uma ferramenta que foi instruído a nunca chamar. Alguém conseguiu em cerca de 60 segundos sem pedir diretamente o segredo. O próximo desafio foca em exfiltração de dados com defesas mais difíceis.

A comunidade determina o que é testado: qualquer pessoa pode propor um desafio (cenário, agente, objetivo), a comunidade vota, e o desafio mais votado entra em funcionamento com um cronômetro. O jailbreak bem-sucedido mais rápido vence.

Detalhes técnicos

O projeto é construído com TypeScript (76,5%), CSS (22,2%) e outras linguagens (1,3%). Usa licença MIT e tem uma comunidade no Discord para discutir técnicas e compartilhar abordagens.

📖 Leia o Source completo: HN AI Agents

Ad

👀 See Also

mcp-scan: Scanner de segurança para configurações de servidor MCP
Security

mcp-scan: Scanner de segurança para configurações de servidor MCP

mcp-scan verifica configurações de servidores MCP para problemas de segurança, incluindo segredos em arquivos de configuração, vulnerabilidades conhecidas em pacotes, padrões de permissão suspeitos, vetores de exfiltração e ataques de envenenamento de ferramentas. Ele detecta automaticamente configurações para Claude Desktop, Cursor, VS Code, Windsurf e 6 outros clientes de IA.

OpenClawRadar
pi-governance: RBAC, DLP e registro de auditoria para agentes de codificação OpenClaw
Security

pi-governance: RBAC, DLP e registro de auditoria para agentes de codificação OpenClaw

pi-governance é um plugin que fica entre os agentes de codificação de IA e seu sistema, classificando chamadas de ferramentas e bloqueando operações arriscadas. Ele fornece bloqueio de comandos bash, varredura DLP para segredos e PII, controle de acesso baseado em função e registro de auditoria estruturado sem configuração.

OpenClawRadar
Sieve: Scanner Secreto Local para Históricos de Chat de Ferramentas de Codificação de IA
Security

Sieve: Scanner Secreto Local para Históricos de Chat de Ferramentas de Codificação de IA

Sieve escaneia históricos de conversas do Cursor, Claude Code, Copilot e outros assistentes de codificação com IA em busca de chaves de API e tokens vazados. Toda a varredura é local, com ocultação e cofre do macOS Keychain.

OpenClawRadar
Malwar: Um Scanner de Vulnerabilidades para Arquivos .md SKILL Construído com Claude Code
Security

Malwar: Um Scanner de Vulnerabilidades para Arquivos .md SKILL Construído com Claude Code

Um desenvolvedor lançou o Malwar, uma ferramenta gratuita que verifica arquivos SKILL.md em busca de instruções maliciosas usando um pipeline de 4 camadas, incluindo um mecanismo de regras, rastreador de URLs, análise de LLM e inteligência de ameaças. A ferramenta foi construída inteiramente com Claude Code depois que o desenvolvedor encontrou padrões preocupantes, como blobs Base64 e instruções para canalizar a saída do curl para o bash em habilidades existentes.

OpenClawRadar