Laboratorio de ataque y defensa RAG de código abierto para pilas locales de ChromaDB + LM Studio

Qué es esto
Aminrj Labs lanzó un laboratorio de ataque y defensa RAG de código abierto que se ejecuta completamente local en hardware de consumo, específicamente dirigido a pilas ChromaDB + LM Studio con fragmentación estándar estilo LangChain. No se requieren servicios en la nube ni claves API—se ejecuta en hardware como un MacBook Pro.
Hallazgos clave del laboratorio
El laboratorio mide la efectividad del envenenamiento de bases de conocimiento contra configuraciones RAG locales predeterminadas. En un sistema ChromaDB sin defensas, los ataques de envenenamiento logran un 95% de éxito. El ataque opera en la capa de recuperación—no se necesita jailbreak, acceso al modelo ni manipulación de prompts. El modelo funciona exactamente como se pretende, solo con contexto envenenado.
Una observación notable sobre la fragmentación predeterminada: con fragmentos de 512 tokens y superposición de 200 tokens, un documento en un límite de fragmento se incrusta dos veces como dos fragmentos independientes. Esto duplica la probabilidad de recuperación sin sofisticación adicional, un efecto secundario de configuraciones que la mayoría de configuraciones locales heredan sin consideración.
El enfoque de defensa más común—filtrado de salida—apunta a la capa incorrecta ya que el compromiso ocurre antes de la generación. La detección de anomalías en incrustaciones durante la ingesta resulta efectiva: puntuar documentos entrantes contra la colección existente antes de escribirlos reduce el éxito del envenenamiento del 95% al 20%.
Con las cinco defensas activas, el éxito residual del envenenamiento es del 10%. Estos casos son semánticamente lo suficientemente cercanos a la línea base que ninguna capa los detecta claramente, representando el límite práctico para la defensa.
Detalles técnicos
- Pila: ChromaDB + LM Studio con Qwen2.5-7B
- Fragmentación: Estándar estilo LangChain con fragmentos de 512 tokens y superposición de 200 tokens
- Éxito del ataque en sistema sin defensas: 95%
- Efectividad de defensa con detección de anomalías en incrustaciones: Reduce el envenenamiento al 20%
- Envenenamiento residual con todas las defensas: 10%
El repositorio contiene la implementación del ataque, versión reforzada y mediciones para cada capa de defensa.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Las herramientas de código abierto de Microsoft hackeadas: malware robacontraseñas ataca repositorios de desarrolladores de IA
Hackers inyectaron malware robacontraseñas en al menos 70 repositorios de Microsoft en GitHub, dirigido a desarrolladores de IA que usan Claude Code, Gemini CLI y VS Code. Es una recompromisión del proyecto Durable Task.

Endo Familiar: Entorno Aislado de Capacidad de Objetos para Agentes de IA
Endo Familiar implementa seguridad de capacidades de objetos para agentes de IA: los agentes comienzan con cero autoridad ambiental, reciben solo referencias explícitas a archivos o directorios específicos, y pueden derivar capacidades más restringidas en código sandbox.

Advertencia de Hosting RunLobster: Se Reportan Spam de Bots y Cargos No Autorizados
Un usuario de Reddit informa que los bots de RunLobster (OpenClaw Hosting) están inundando subreddits de tecnología y que su tarjeta recibió tres cargos no autorizados inmediatamente después del registro, sin respuesta del soporte.

Vulnerabilidades de seguridad expuestas en la aplicación EdTech presentada por Lovable
Un investigador de seguridad encontró 16 vulnerabilidades en una aplicación EdTech destacada en Lovable, incluyendo fallos críticos en la lógica de autenticación que expusieron 18,697 registros de usuarios sin necesidad de autenticación. La aplicación tenía más de 100K visualizaciones en el escaparate de Lovable y usuarios reales de UC Berkeley, UC Davis y escuelas de todo el mundo.