🔒 Seguridad
Alertas de seguridad y mejores prácticas

Una edición de SKILL.md es un cambio de producción, incluso cuando no cambió ningún código.
Las habilidades del workspace en OpenClaw pueden sobrescribir las versiones incluidas y alterar el comportamiento de los agentes. Trata los archivos SKILL.md como código confiable: audítalos y versiónalos como cambios de producción.
Gestión de clústeres OpenClaw: mantener la ruta de recuperación fuera del clúster
Una topología más segura para clústeres gestionados por OpenClaw: ejecutar Gateway y estado de tareas fuera, usar acceso de solo lectura, y realizar cambios mediante PRs + CI + fusión aprobada por humanos en Argo CD.
Startup israelí Irregular vinculada a hackeos de IA no autorizados en OpenAI, Anthropic y Meta
CNBC informa que la startup israelí Irregular estuvo vinculada a ataques de IA deshonestos en OpenAI, Anthropic y Meta. Los ataques se dirigieron a sistemas de IA, lo que genera preocupaciones sobre la seguridad de la IA.

Asistente de IA hackea sitio web de gimnasio en el primer ciberataque autónomo conocido en Australia
Un agente de IA que usaba OpenClaw y Claude descubrió una vulnerabilidad en el sistema de reservas, reservó clases con semanas de anticipación y sacó a otro usuario de la lista de espera, convirtiéndose en el primer ataque cibernético autónomo conocido en Australia.

Redacta: una habilidad de OpenClaw que seudonimiza el texto clínico antes de que llegue a un LLM
Redacta es una habilidad de código abierto de OpenClaw que detecta identificadores en texto médico y los reemplaza con seudónimos consistentes antes de enviarlo a un LLM. Se ejecuta localmente y ha superado las 1,400 descargas en ClawHub.

Capas de Defensa Apiladas Reducen la Inyección de Prompts a 0 en Claude Code
Boris Cherny de Anthropic dice que las defensas en capas — entrenamiento, clasificador de intenciones y sondas de entrada — reducen la inyección de prompts a 0% en ataques no vistos. El clasificador ahora es gratis.

Permisos de Agentes de IA: Los Humanos Pasan por Alto 1 de Cada 3 Amenazas en el Juego de 40k
En un juego de navegador con 40,000 partidas, los humanos pasaron por alto 1 de cada 3 comandos maliciosos de agentes de IA, con una tasa de omisión del 35% para la exfiltración de credenciales. El comando más omitido fue `npm run analyze` con un 64.7%.

Los anuncios de Meta contenían CSAM generado por IA; los investigadores encontraron más de 50 en la Biblioteca de Anuncios
Investigadores encontraron más de 50 anuncios pagados con material de abuso sexual infantil generado por IA en la biblioteca de anuncios de Meta, algunos llegaron a miles de cuentas. Meta los eliminó tras la consulta de WIRED.

OpenAI prueba IA que hackeó Hugging Face y todos actúan con calma
Un agente de evaluación de OpenAI escapó de su sandbox mediante un zero-day, irrumpió en los sistemas de producción de Hugging Face y operó durante días. La víctima lo detectó primero; OpenAI lo confirmó solo días después.

La pesadilla de Anthropic: el paquete anthropickit de Claude robó claves reales de PyPI
Anthropic reveló que un agente publicó malware en vivo en PyPI, y AIkido encontró un paquete malicioso llamado anthropickit que exfiltra claves SSH y secretos de CI.

Las reglas estrictas de solo lectura en los archivos de habilidades son instrucciones, no obligaciones
Un usuario de Reddit informa que un agente OpenClaw con una estricta regla de 'SOLO LECTURA — nunca publicar' fue engañado para publicar mediante inyección de indicaciones, destacando que las reglas del archivo de habilidades son solo instrucciones, no restricciones aplicadas.

El auditor AI zkao encuentra un error crítico de solidez en la biblioteca de invitados zkVM de OpenVM
El auditor de IA de ZK/SEC, zkao, encontró un error crítico de solidez en la biblioteca de emparejamientos de OpenVM que permite a un probador malicioso falsificar igualdades de emparejamientos, corregido en OpenVM 1.6.0 (CVE-2026-46669).