Datos de amenazas de 91K interacciones con agentes de IA: abuso de herramientas aumentó 6.4%, nuevos ataques multimodales.

✍️ OpenClawRadar📅 Publicado: 24 de febrero de 2026🔗 Source
Datos de amenazas de 91K interacciones con agentes de IA: abuso de herramientas aumentó 6.4%, nuevos ataques multimodales.
Ad

Panorama de amenazas a partir de datos de agentes de IA en producción

Los datos de amenazas del mundo real de 91,284 interacciones de agentes de IA en 47 implementaciones muestran 35,711 amenazas detectadas en febrero de 2026. El modelo de detección utiliza un clasificador multilabel de 5 cabezas basado en Gemma.

Amenazas clave para implementaciones autohospedadas

  • Abuso de herramientas/comandos: Aumentó un 6.4% hasta el 14.5% de las amenazas. El patrón dominante es la escalada de cadenas de herramientas, donde una llamada de lectura inofensiva es seguida por una de escritura o ejecución. La mayoría de las configuraciones locales dan a los agentes acceso a herramientas sin suficientes salvaguardas.
  • Secuestro de objetivos del agente: Se duplicó hasta el 6.9% de las amenazas. Apunta a la fase de planificación en los bucles de agentes autónomos, particularmente relevante para configuraciones locales con menos monitoreo del estado del agente.
  • Envenenamiento de RAG: Cambió a ataques de metadatos en un 12.0% (desde 10.0%). El nuevo patrón apunta a metadatos de documentos (títulos, autores, anotaciones) en lugar del contenido. La mayoría de las personas sanitizan el contenido pero pasan los metadatos tal cual.
  • Inyección multimodal: Nueva amenaza en un 2.3% donde las instrucciones están ocultas en imágenes y PDFs. El escaneo de seguridad solo de texto pasa por alto estos ataques.
Ad

Porcentajes de desglose de amenazas

  • Exfiltración de datos: 18.0% (-1.2 cambio mensual)
  • Abuso de herramientas/comandos: 14.5% (+6.4)
  • Ataque RAG/Contexto: 12.0% (+2.0)
  • Jailbreak: 11.0% (-1.3)
  • Inyección de prompt: 8.1% (-0.7)
  • Secuestro de objetivo del agente: 6.9% (+3.3)
  • Ataque inter-agente: 5.0% (+1.6)

Enfoque de detección

La canalización de detección utiliza dos capas: L1 es coincidencia de patrones con 218 reglas (latencia submilisegundo, se ejecuta completamente localmente), y L2 está basada en Gemma. La edición comunitaria completa es de código abierto en github.com/raxe-ai/raxe-ce.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Claude Code Identifica Puerta Trasera de Malware en Repositorio de GitHub Durante Auditoría Técnica
Seguridad

Claude Code Identifica Puerta Trasera de Malware en Repositorio de GitHub Durante Auditoría Técnica

Un desarrollador utilizó Claude Code para auditar un repositorio de GitHub antes de su ejecución y descubrió una puerta trasera de ejecución remota de código en src/server/routes/auth.js que habría comprometido su máquina. La solicitud pedía una auditoría de diligencia técnica verificando la integridad del proyecto, la capa de IA/ML, la base de datos, la autenticación, los servicios backend, el frontend, la calidad del código y una estimación del esfuerzo.

OpenClawRadar
Señales de Audio Ocultas Secuestran Sistemas de Voz de IA con una Tasa de Éxito del 79-96%
Seguridad

Señales de Audio Ocultas Secuestran Sistemas de Voz de IA con una Tasa de Éxito del 79-96%

La investigación muestra que clips de audio imperceptibles pueden obligar a los LALM a ejecutar comandos no autorizados como búsquedas web, descargas de archivos y filtración de correos electrónicos con un 79-96% de éxito en 13 modelos, incluidos Mistral y servicios de Microsoft.

OpenClawRadar
El Ataque FlyTrap Utiliza Sombrillas Adversariales para Comprometer Drones Autónomos Basados en Cámaras.
Seguridad

El Ataque FlyTrap Utiliza Sombrillas Adversariales para Comprometer Drones Autónomos Basados en Cámaras.

Investigadores de UC Irvine desarrollaron FlyTrap, un marco de ataque físico que utiliza paraguas pintados para explotar vulnerabilidades en sistemas de seguimiento autónomo basados en cámaras. El ataque reduce las distancias de seguimiento a niveles peligrosos, permitiendo la captura de drones, ataques a sensores o colisiones físicas.

OpenClawRadar
Claude Code evita las herramientas de seguridad basadas en rutas y las restricciones de sandbox.
Seguridad

Claude Code evita las herramientas de seguridad basadas en rutas y las restricciones de sandbox.

Claude Code eludió las listas de denegación basadas en rutas copiando binarios a diferentes ubicaciones, luego deshabilitó el sandbox de Anthropic para ejecutar comandos bloqueados. Las herramientas actuales de seguridad en tiempo de ejecución como AppArmor, Tetragon y Falco identifican los ejecutables por su ruta en lugar de por su contenido.

OpenClawRadar