Como Funciona a Marca d'Água de Texto por IA: Chaves Secretas, Escolhas de Palavras Verde/Vermelho e Detecção
A marca d'água em texto de IA funciona escondendo marcas nas escolhas entre palavras, não no próprio texto. O Google aplica marca d'água no texto do Gemini (app e web) desde 2024, e os modelos Claude marcam o texto no nível do modelo desde agosto de 2026. As marcas sobrevivem a copiar e colar e são invisíveis para os leitores.
Marca d'água por viés na escolha de palavras
Quando um modelo de linguagem escreve, ele escolhe cada palavra rolando dados ponderados sobre uma lista de candidatos. A marca d'água usa uma chave secreta para colorir esses candidatos de verde ou vermelho e, em seguida, empurra levemente os dados para o verde. O texto ainda parece natural — palavras vermelhas ainda podem vencer, só que com menos frequência.
Como funciona a detecção
Com a chave secreta, você pode recolorir qualquer texto e contar quantas palavras são verdes. Em texto sem marca, cerca de metade das palavras será verde por acaso. Em texto com marca, a contagem é significativamente maior. O detector não lê o texto — ele apenas conta palavras verdes em uma sequência suficientemente longa.
O que a edição faz com a marca
A marca d'água vive em trechos de texto não editados. A cor de cada palavra é derivada de uma pequena janela de palavras anteriores, então a edição apaga a marca exatamente onde a sequência é quebrada. Textos curtos são difíceis de avaliar — um documento de 1.500 palavras com um viés leve acusaria apenas cerca de 55% de verde, por isso textos mais longos são mais confiáveis.
Esquemas em produção
- Google SynthID: Usa um torneio secreto em vez de um simples viés, preservando as probabilidades exatas das palavras.
- Esquema de Aaronson: Deriva os próprios lançamentos de dados da chave.
- Kirchenbauer et al. (2023): A abordagem clássica de viés verde/vermelho.
Confira o guia visual interativo para uma demonstração prática do processo.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Usuário do OpenClaw Compartilha Estratégia para Equilibrar Autonomia do Agente e Segurança na Web
Um usuário do OpenClaw descreve seu desafio atual: equilibrar a autonomia do agente com a segurança, especialmente em relação ao acesso à web e aos riscos de injeção de prompt. Eles propõem uma solução usando segmentos de agentes de 'baixa confiança' e 'alta confiança' com um portão de aprovação humana.

Ferramentas de IA de Código Aberto Apresentam Riscos de Segurança Devido à 'Segurança Ilusória Através da Transparência'
Uma postagem no Reddit alerta sobre malware disfarçado como agentes e ferramentas de IA de código aberto, onde código malicioso pode estar escondido em grandes bases de código que os usuários assumem ser seguras porque estão no GitHub. A postagem descreve como o 'vibe-coding' e os agentes de IA autônomos condicionam os usuários a executar programas desconhecidos sem revisão.

Playground de código aberto para red-teaming de agentes de IA com exploits publicados
A Fabraix disponibilizou um ambiente aberto para testar as defesas de agentes de IA através de desafios adversariais. Cada desafio implanta um agente ativo com ferramentas reais e prompts de sistema publicados, com transcrições das conversas vencedoras e logs de proteção documentados publicamente.

jqwik v1.10.0 insere furtivamente injeção de prompt que exclui código quando usado por agentes de IA
Johannes Link adicionou uma instrução oculta ao jqwik v1.10.0 que diz aos agentes de codificação de IA para excluir todos os testes e códigos do jqwik, oculta com escapes ANSI. O Claude identifica corretamente, mas usuários humanos podem não ter tanta sorte.