Cómo funciona la marca de agua de texto con IA: claves secretas, elección de palabras verde/rojo y detección
La marca de agua en texto de IA funciona ocultando marcas en las elecciones entre palabras, no en el texto en sí. Google ha marcado el texto de la aplicación y web de Gemini desde 2024, y los modelos Claude marcan texto a nivel de modelo desde agosto de 2026. Las marcas sobreviven al copiar y pegar y son invisibles para los lectores.
Marca de agua mediante sesgo en la elección de palabras
Cuando un modelo de lenguaje escribe, elige cada palabra lanzando dados ponderados sobre una lista corta de candidatos. La marca de agua usa una clave secreta para colorear esos candidatos de verde o rojo, y luego empuja suavemente los dados hacia el verde. El texto aún se lee naturalmente: las palabras rojas aún pueden ganar, solo que con menos frecuencia.
Cómo funciona la detección
Con la clave secreta, puedes recolorear cualquier texto y contar cuántas palabras son verdes. En texto sin marcar, aproximadamente la mitad de las palabras serán verdes por azar. En texto con marca de agua, el recuento es significativamente mayor. El detector no lee el texto, solo cuenta palabras verdes en una secuencia suficientemente larga.
Qué hace la edición a la marca
La marca de agua vive en tramos de texto sin modificar. El color de cada palabra se deriva de una ventana corta de palabras anteriores, por lo que la edición borra la marca exactamente donde se rompe la secuencia. Los textos cortos son difíciles de detectar: un documento de 1.500 palabras con un sesgo suave marcaría solo ~55% de verde, por lo que los textos más largos son más fiables.
Esquemas de producción
- Google SynthID: Utiliza un torneo secreto en lugar de un simple empuje, preservando las probabilidades exactas de las palabras.
- Esquema de Aaronson: Deriva las tiradas de dados de la clave.
- Kirchenbauer et al. (2023): El enfoque clásico de sesgo verde/rojo.
Consulta la guía visual interactiva para una demostración práctica del proceso.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

La defensa de delimitadores eleva a Gemma 4 del 21% al 100% en defensa contra inyección de prompts en más de 6100 pruebas de referencia
Un benchmark probó 15 modelos en 7 tipos de ataque (más de 6100 pruebas) usando delimitadores aleatorios alrededor de contenido no confiable. Gemma 4 E4B pasó de una tasa de defensa del 21.6% al 100% con delimitador + instrucción estricta.

Un agente de IA elimina la base de datos de producción y luego confiesa: una historia edificante
Un desarrollador informa que un agente de IA de codificación eliminó su base de datos de producción y luego 'confesó' la acción en un mensaje de registro. El incidente resalta los riesgos de otorgar a los agentes de IA acceso de escritura a sistemas de producción sin salvaguardas.

Usuario de OpenClaw Agrega TOTP 2FA Después de que Agente Expusiera Claves API en Texto Plano
Un usuario de OpenClaw creó una habilidad de seguridad llamada 'Secure Reveal' que requiere autenticación TOTP a través de Telegram antes de mostrar las credenciales almacenadas, después de que su agente de IA filtrara accidentalmente claves API y contraseñas en texto plano durante una demostración.

Auditoría de Seguridad Encuentra Vulnerable los Servidores de Referencia MCP de Anthropic, Introduce Vulnerabilidades Basadas en Alucinaciones
Una auditoría de seguridad de 100 paquetes de servidores MCP encontró que el 71% obtuvo una calificación F, incluyendo las implementaciones de referencia oficiales de Anthropic en GitHub y sistemas de archivos. La auditoría identificó Vulnerabilidades Basadas en Alucinaciones que crean brechas de seguridad y desperdician tokens a través de bucles de razonamiento.