Cómo funciona la marca de agua de texto con IA: claves secretas, elección de palabras verde/rojo y detección
La marca de agua en texto de IA funciona ocultando marcas en las elecciones entre palabras, no en el texto en sí. Google ha marcado el texto de la aplicación y web de Gemini desde 2024, y los modelos Claude marcan texto a nivel de modelo desde agosto de 2026. Las marcas sobreviven al copiar y pegar y son invisibles para los lectores.
Marca de agua mediante sesgo en la elección de palabras
Cuando un modelo de lenguaje escribe, elige cada palabra lanzando dados ponderados sobre una lista corta de candidatos. La marca de agua usa una clave secreta para colorear esos candidatos de verde o rojo, y luego empuja suavemente los dados hacia el verde. El texto aún se lee naturalmente: las palabras rojas aún pueden ganar, solo que con menos frecuencia.
Cómo funciona la detección
Con la clave secreta, puedes recolorear cualquier texto y contar cuántas palabras son verdes. En texto sin marcar, aproximadamente la mitad de las palabras serán verdes por azar. En texto con marca de agua, el recuento es significativamente mayor. El detector no lee el texto, solo cuenta palabras verdes en una secuencia suficientemente larga.
Qué hace la edición a la marca
La marca de agua vive en tramos de texto sin modificar. El color de cada palabra se deriva de una ventana corta de palabras anteriores, por lo que la edición borra la marca exactamente donde se rompe la secuencia. Los textos cortos son difíciles de detectar: un documento de 1.500 palabras con un sesgo suave marcaría solo ~55% de verde, por lo que los textos más largos son más fiables.
Esquemas de producción
- Google SynthID: Utiliza un torneo secreto en lugar de un simple empuje, preservando las probabilidades exactas de las palabras.
- Esquema de Aaronson: Deriva las tiradas de dados de la clave.
- Kirchenbauer et al. (2023): El enfoque clásico de sesgo verde/rojo.
Consulta la guía visual interactiva para una demostración práctica del proceso.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Garra Abierta: Riesgos de Seguridad por Permisos Flojos en Bots de Discord
Un investigador de seguridad demuestra cómo OpenClaw puede ser explotado cuando los usuarios añaden el bot del asistente de IA a su servidor de Discord con permisos excesivos, dirigido a usuarios que otorgan acceso root/administrador sin considerar los controles de seguridad.

Los anuncios de Meta contenían CSAM generado por IA; los investigadores encontraron más de 50 en la Biblioteca de Anuncios
Investigadores encontraron más de 50 anuncios pagados con material de abuso sexual infantil generado por IA en la biblioteca de anuncios de Meta, algunos llegaron a miles de cuentas. Meta los eliminó tras la consulta de WIRED.

VulnHunter: La herramienta de seguridad de código con IA agente de Capital One ahora es de código abierto
Capital One ha lanzado como código abierto VulnHunter, una herramienta de IA agente que simula puntos de entrada de atacantes, falsifica hallazgos para reducir falsos positivos y genera correcciones de código específicas.

El Ataque FlyTrap Utiliza Sombrillas Adversariales para Comprometer Drones Autónomos Basados en Cámaras.
Investigadores de UC Irvine desarrollaron FlyTrap, un marco de ataque físico que utiliza paraguas pintados para explotar vulnerabilidades en sistemas de seguimiento autónomo basados en cámaras. El ataque reduce las distancias de seguimiento a niveles peligrosos, permitiendo la captura de drones, ataques a sensores o colisiones físicas.