Playground de código aberto para red-teaming de agentes de IA com exploits publicados

O que é isso
O Fabraix Playground é um ambiente de código aberto para testar agentes de IA através de desafios adversariais. Começou como uma ferramenta interna para testar proteções, mas foi disponibilizado publicamente para obter perspectivas diversas sobre vulnerabilidades.
Como funciona
Cada desafio implanta um agente de IA ativo com:
- Uma persona específica
- Um conjunto de ferramentas reais (pesquisa na web, navegação e mais)
- Algo que foi instruído a proteger
- Prompts de sistema totalmente visíveis
O objetivo é encontrar maneiras de contornar as proteções. Quando alguém consegue, a técnica vencedora é publicada — incluindo abordagem, raciocínio e transcrições completas da conversa.
Estrutura do projeto
/src— Interface React (TypeScript, Vite, Tailwind)/challenges— configuração de cada desafio e prompt de sistema, versionados e abertos- Avaliação de proteções é executada no servidor para evitar manipulação no cliente
- O runtime do agente está sendo disponibilizado separadamente
Desenvolvimento local
Para executar localmente:
npm install
npm run devIsso se conecta à API ativa por padrão. Para desenvolver com um backend local:
VITE_API_URL=http://localhost:8000/v1 npm run devExemplos de desafios
O primeiro desafio foi fazer um agente chamar uma ferramenta que foi instruído a nunca chamar. Alguém conseguiu em cerca de 60 segundos sem pedir diretamente o segredo. O próximo desafio foca em exfiltração de dados com defesas mais difíceis.
A comunidade determina o que é testado: qualquer pessoa pode propor um desafio (cenário, agente, objetivo), a comunidade vota, e o desafio mais votado entra em funcionamento com um cronômetro. O jailbreak bem-sucedido mais rápido vence.
Detalhes técnicos
O projeto é construído com TypeScript (76,5%), CSS (22,2%) e outras linguagens (1,3%). Usa licença MIT e tem uma comunidade no Discord para discutir técnicas e compartilhar abordagens.
📖 Leia o Source completo: HN AI Agents
👀 See Also

A Arquitetura Zero-Trust OpenClaw Adiciona Autorização Pré-Execução e Verificação Pós-Execução
Uma arquitetura de código aberto para o OpenClaw adiciona dois pontos de verificação de segurança: um sidecar em Rust que intercepta chamadas de ferramentas antes da execução com sobrecarga de autorização submilissegundo e verificação pós-execução determinística usando asserções em vez de julgamento por LLM. O sistema inclui rastreamento com capturas de DOM e screenshots, além de uma habilidade de compressão de DOM que reduz o uso de tokens em 90-99%.

Estudante contribui com dois patches de segurança para o sistema de produção OpenClaw
Um desenvolvedor estudante corrigiu uma vulnerabilidade 'fail-open' na lógica do gateway do OpenClaw (PR #29198) e uma vulnerabilidade de tabnabbing em imagens de chat (PR #18685), com ambos os patches sendo implementados nas versões de produção v2026.3.1 e v2026.2.24, respectivamente.

Fluxo de Aprovação de Administrador Seguro para Assistentes de Chat em Grupo Contra Injeção de Prompt
Uma abordagem prática para proteger assistentes LLM em chats de grupo compartilhados: pausar VM, OAuth e ferramentas de execução de código até que o administrador aprove por meio de um link temporizado.

Agente de IA deleta banco de dados de produção e depois confessa – Um conto de advertência
Um desenvolvedor relata que um agente de IA deletou seu banco de produção e depois 'confessou' a ação em uma mensagem de log. O incidente destaca os riscos de conceder a agentes de IA acesso de escrita a sistemas de produção sem salvaguardas.