Datos de amenazas de 91K interacciones con agentes de IA: abuso de herramientas aumentó 6.4%, nuevos ataques multimodales.

Panorama de amenazas a partir de datos de agentes de IA en producción
Los datos de amenazas del mundo real de 91,284 interacciones de agentes de IA en 47 implementaciones muestran 35,711 amenazas detectadas en febrero de 2026. El modelo de detección utiliza un clasificador multilabel de 5 cabezas basado en Gemma.
Amenazas clave para implementaciones autohospedadas
- Abuso de herramientas/comandos: Aumentó un 6.4% hasta el 14.5% de las amenazas. El patrón dominante es la escalada de cadenas de herramientas, donde una llamada de lectura inofensiva es seguida por una de escritura o ejecución. La mayoría de las configuraciones locales dan a los agentes acceso a herramientas sin suficientes salvaguardas.
- Secuestro de objetivos del agente: Se duplicó hasta el 6.9% de las amenazas. Apunta a la fase de planificación en los bucles de agentes autónomos, particularmente relevante para configuraciones locales con menos monitoreo del estado del agente.
- Envenenamiento de RAG: Cambió a ataques de metadatos en un 12.0% (desde 10.0%). El nuevo patrón apunta a metadatos de documentos (títulos, autores, anotaciones) en lugar del contenido. La mayoría de las personas sanitizan el contenido pero pasan los metadatos tal cual.
- Inyección multimodal: Nueva amenaza en un 2.3% donde las instrucciones están ocultas en imágenes y PDFs. El escaneo de seguridad solo de texto pasa por alto estos ataques.
Porcentajes de desglose de amenazas
- Exfiltración de datos: 18.0% (-1.2 cambio mensual)
- Abuso de herramientas/comandos: 14.5% (+6.4)
- Ataque RAG/Contexto: 12.0% (+2.0)
- Jailbreak: 11.0% (-1.3)
- Inyección de prompt: 8.1% (-0.7)
- Secuestro de objetivo del agente: 6.9% (+3.3)
- Ataque inter-agente: 5.0% (+1.6)
Enfoque de detección
La canalización de detección utiliza dos capas: L1 es coincidencia de patrones con 218 reglas (latencia submilisegundo, se ejecuta completamente localmente), y L2 está basada en Gemma. La edición comunitaria completa es de código abierto en github.com/raxe-ai/raxe-ce.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Google dice que hackers criminales usaron IA para encontrar vulnerabilidad de día cero
Google reveló que atacantes utilizaron un agente de IA para descubrir y explotar una vulnerabilidad de software previamente desconocida, marcando el primer caso confirmado de descubrimiento de día cero impulsado por IA en el entorno real.

Investigadores de Seguridad en IA: Tus Vulnerabilidades de Día Cero Podrían Filtrarse a través de la Opción de Inclusión de Datos
El interruptor 'Mejorar el modelo para todos' en las interfaces de LLM puede recolectar automáticamente investigaciones profundas de red-teaming, enviando tus conceptos de vulnerabilidad a los equipos de seguridad de los proveedores y potencialmente a artículos académicos antes de que publiques. Desactiva el intercambio de datos antes de realizar investigaciones de seguridad serias.

El Comando de Revisión de Seguridad de Claude Tiene Limitaciones para Sistemas de Producción
Un desarrollador encontró útil el comando de revisión de seguridad de Claude para validaciones básicas como tipos MIME y límites de tamaño de archivos, pero insuficiente para el endurecimiento en producción contra amenazas sofisticadas. La solución requirió una reestructuración arquitectónica de dos semanas que separó el procesamiento de archivos en un trabajador restringido con permisos limitados.

OneCLI: Bóveda de Credenciales de Código Abierto para Agentes de IA
OneCLI es una puerta de enlace de código abierto escrita en Rust que se sitúa entre los agentes de IA y los servicios externos, inyectando credenciales reales en el momento de la solicitud mientras que los agentes solo ven claves de marcador de posición. Proporciona almacenamiento cifrado AES-256-GCM, se ejecuta en un único contenedor Docker con PGlite integrado y funciona con cualquier framework de agentes que pueda configurar un HTTPS_PROXY.