Parque de juegos de código abierto para agentes de inteligencia artificial de equipo rojo con exploits publicados.

✍️ OpenClawRadar📅 Publicado: 16 de marzo de 2026🔗 Source
Parque de juegos de código abierto para agentes de inteligencia artificial de equipo rojo con exploits publicados.
Ad

Qué es esto

Fabraix Playground es un entorno de código abierto para realizar pruebas de ataque (red-teaming) en agentes de IA mediante desafíos adversarios. Comenzó como una herramienta interna para probar barreras de seguridad, pero se liberó como código abierto para obtener perspectivas diversas sobre vulnerabilidades.

Cómo funciona

Cada desafío despliega un agente de IA en vivo con:

  • Una persona específica
  • Un conjunto de herramientas reales (búsqueda web, navegación y más)
  • Algo que se le ha instruido proteger
  • Prompts de sistema completamente visibles

El objetivo es encontrar formas de superar las barreras de seguridad. Cuando alguien tiene éxito, la técnica ganadora se publica, incluyendo el enfoque, el razonamiento y las transcripciones completas de la conversación.

Estructura del proyecto

  • /src — Interfaz frontend en React (TypeScript, Vite, Tailwind)
  • /challenges — cada configuración de desafío y prompt de sistema, versionado y abierto
  • Las evaluaciones de barreras de seguridad se ejecutan en el servidor para evitar manipulaciones del lado del cliente
  • El entorno de ejecución del agente se está liberando como código abierto por separado
Ad

Desarrollo local

Para ejecutar localmente:

npm install
npm run dev

Esto se conecta a la API en vivo por defecto. Para desarrollar contra un backend local:

VITE_API_URL=http://localhost:8000/v1 npm run dev

Ejemplos de desafíos

El primer desafío fue hacer que un agente llamara a una herramienta que se le dijo que nunca llamara. Alguien lo logró en aproximadamente 60 segundos sin pedir directamente el secreto. El próximo desafío se centra en la exfiltración de datos con defensas más difíciles.

La comunidad impulsa lo que se prueba: cualquiera puede proponer un desafío (escenario, agente, objetivo), la comunidad vota, y el desafío más votado se activa con un reloj en cuenta regresiva. El jailbreak exitoso más rápido gana.

Detalles técnicos

El proyecto está construido con TypeScript (76.5%), CSS (22.2%) y otros lenguajes (1.3%). Utiliza licencia MIT y tiene una comunidad de Discord para discutir técnicas y compartir enfoques.

📖 Leer la fuente completa: HN AI Agents

Ad

👀 Ver también

Aislamiento de capa de proxy para la seguridad de la clave API del agente local
Seguridad

Aislamiento de capa de proxy para la seguridad de la clave API del agente local

Un desarrollador comparte un enfoque para el aislamiento de claves API en configuraciones locales de agentes utilizando un proxy en Rust que reemplaza tokens de marcador por credenciales reales, evitando la exposición en la memoria del agente, registros, ventanas de contexto y entornos de herramientas.

OpenClawRadar
Anuncio malicioso de Google apunta a la instalación de código de Claude
Seguridad

Anuncio malicioso de Google apunta a la instalación de código de Claude

Un anuncio malicioso de Google aparece como el primer resultado en las búsquedas de 'install claude code', intentando engañar a los usuarios para que ejecuten comandos sospechosos en la terminal. El anuncio seguía activo hasta el 15 de marzo de 2026, y el autor evitó por poco ejecutar el código.

OpenClawRadar
Malwar: Un Escáner de Vulnerabilidades para Archivos SKILL.md Construido con Claude Code
Seguridad

Malwar: Un Escáner de Vulnerabilidades para Archivos SKILL.md Construido con Claude Code

Un desarrollador ha lanzado Malwar, una herramienta gratuita que escanea archivos SKILL.md en busca de instrucciones maliciosas utilizando una canalización de 4 capas que incluye un motor de reglas, un rastreador de URL, análisis con LLM e inteligencia de amenazas. La herramienta fue construida completamente con Claude Code después de que el desarrollador encontrara patrones preocupantes como bloques Base64 e instrucciones para canalizar la salida de curl a bash en habilidades existentes.

OpenClawRadar
Caelguard: Escáner de Seguridad de Código Abierto para Instancias de OpenClaw
Seguridad

Caelguard: Escáner de Seguridad de Código Abierto para Instancias de OpenClaw

Caelguard es un escáner de seguridad de código abierto diseñado para OpenClaw que ejecuta 22 verificaciones en tu instancia, incluyendo aislamiento de Docker, alcance de permisos de herramientas y verificación de la cadena de suministro de habilidades. Proporciona una puntuación sobre 140 con una calificación por letra y pasos de remediación específicos.

OpenClawRadar