Laboratorio de ataque y defensa RAG de código abierto para pilas locales de ChromaDB + LM Studio

✍️ OpenClawRadar📅 Publicado: 18 de marzo de 2026🔗 Source
Laboratorio de ataque y defensa RAG de código abierto para pilas locales de ChromaDB + LM Studio
Ad

Qué es esto

Aminrj Labs lanzó un laboratorio de ataque y defensa RAG de código abierto que se ejecuta completamente local en hardware de consumo, específicamente dirigido a pilas ChromaDB + LM Studio con fragmentación estándar estilo LangChain. No se requieren servicios en la nube ni claves API—se ejecuta en hardware como un MacBook Pro.

Hallazgos clave del laboratorio

El laboratorio mide la efectividad del envenenamiento de bases de conocimiento contra configuraciones RAG locales predeterminadas. En un sistema ChromaDB sin defensas, los ataques de envenenamiento logran un 95% de éxito. El ataque opera en la capa de recuperación—no se necesita jailbreak, acceso al modelo ni manipulación de prompts. El modelo funciona exactamente como se pretende, solo con contexto envenenado.

Una observación notable sobre la fragmentación predeterminada: con fragmentos de 512 tokens y superposición de 200 tokens, un documento en un límite de fragmento se incrusta dos veces como dos fragmentos independientes. Esto duplica la probabilidad de recuperación sin sofisticación adicional, un efecto secundario de configuraciones que la mayoría de configuraciones locales heredan sin consideración.

El enfoque de defensa más común—filtrado de salida—apunta a la capa incorrecta ya que el compromiso ocurre antes de la generación. La detección de anomalías en incrustaciones durante la ingesta resulta efectiva: puntuar documentos entrantes contra la colección existente antes de escribirlos reduce el éxito del envenenamiento del 95% al 20%.

Con las cinco defensas activas, el éxito residual del envenenamiento es del 10%. Estos casos son semánticamente lo suficientemente cercanos a la línea base que ninguna capa los detecta claramente, representando el límite práctico para la defensa.

Ad

Detalles técnicos

  • Pila: ChromaDB + LM Studio con Qwen2.5-7B
  • Fragmentación: Estándar estilo LangChain con fragmentos de 512 tokens y superposición de 200 tokens
  • Éxito del ataque en sistema sin defensas: 95%
  • Efectividad de defensa con detección de anomalías en incrustaciones: Reduce el envenenamiento al 20%
  • Envenenamiento residual con todas las defensas: 10%

El repositorio contiene la implementación del ataque, versión reforzada y mediciones para cada capa de defensa.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Las herramientas de código abierto de Microsoft hackeadas: malware robacontraseñas ataca repositorios de desarrolladores de IA
Seguridad

Las herramientas de código abierto de Microsoft hackeadas: malware robacontraseñas ataca repositorios de desarrolladores de IA

Hackers inyectaron malware robacontraseñas en al menos 70 repositorios de Microsoft en GitHub, dirigido a desarrolladores de IA que usan Claude Code, Gemini CLI y VS Code. Es una recompromisión del proyecto Durable Task.

OpenClawRadar
Endo Familiar: Entorno Aislado de Capacidad de Objetos para Agentes de IA
Seguridad

Endo Familiar: Entorno Aislado de Capacidad de Objetos para Agentes de IA

Endo Familiar implementa seguridad de capacidades de objetos para agentes de IA: los agentes comienzan con cero autoridad ambiental, reciben solo referencias explícitas a archivos o directorios específicos, y pueden derivar capacidades más restringidas en código sandbox.

OpenClawRadar
Advertencia de Hosting RunLobster: Se Reportan Spam de Bots y Cargos No Autorizados
Seguridad

Advertencia de Hosting RunLobster: Se Reportan Spam de Bots y Cargos No Autorizados

Un usuario de Reddit informa que los bots de RunLobster (OpenClaw Hosting) están inundando subreddits de tecnología y que su tarjeta recibió tres cargos no autorizados inmediatamente después del registro, sin respuesta del soporte.

OpenClawRadar
Vulnerabilidades de seguridad expuestas en la aplicación EdTech presentada por Lovable
Seguridad

Vulnerabilidades de seguridad expuestas en la aplicación EdTech presentada por Lovable

Un investigador de seguridad encontró 16 vulnerabilidades en una aplicación EdTech destacada en Lovable, incluyendo fallos críticos en la lógica de autenticación que expusieron 18,697 registros de usuarios sin necesidad de autenticación. La aplicación tenía más de 100K visualizaciones en el escaparate de Lovable y usuarios reales de UC Berkeley, UC Davis y escuelas de todo el mundo.

OpenClawRadar