Como Funciona a Marca d'Água de Texto por IA: Chaves Secretas, Escolhas de Palavras Verde/Vermelho e Detecção
A marca d'água em texto de IA funciona escondendo marcas nas escolhas entre palavras, não no próprio texto. O Google aplica marca d'água no texto do Gemini (app e web) desde 2024, e os modelos Claude marcam o texto no nível do modelo desde agosto de 2026. As marcas sobrevivem a copiar e colar e são invisíveis para os leitores.
Marca d'água por viés na escolha de palavras
Quando um modelo de linguagem escreve, ele escolhe cada palavra rolando dados ponderados sobre uma lista de candidatos. A marca d'água usa uma chave secreta para colorir esses candidatos de verde ou vermelho e, em seguida, empurra levemente os dados para o verde. O texto ainda parece natural — palavras vermelhas ainda podem vencer, só que com menos frequência.
Como funciona a detecção
Com a chave secreta, você pode recolorir qualquer texto e contar quantas palavras são verdes. Em texto sem marca, cerca de metade das palavras será verde por acaso. Em texto com marca, a contagem é significativamente maior. O detector não lê o texto — ele apenas conta palavras verdes em uma sequência suficientemente longa.
O que a edição faz com a marca
A marca d'água vive em trechos de texto não editados. A cor de cada palavra é derivada de uma pequena janela de palavras anteriores, então a edição apaga a marca exatamente onde a sequência é quebrada. Textos curtos são difíceis de avaliar — um documento de 1.500 palavras com um viés leve acusaria apenas cerca de 55% de verde, por isso textos mais longos são mais confiáveis.
Esquemas em produção
- Google SynthID: Usa um torneio secreto em vez de um simples viés, preservando as probabilidades exatas das palavras.
- Esquema de Aaronson: Deriva os próprios lançamentos de dados da chave.
- Kirchenbauer et al. (2023): A abordagem clássica de viés verde/vermelho.
Confira o guia visual interativo para uma demonstração prática do processo.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Anúncios do Meta continham CSAM gerado por IA; pesquisadores encontraram mais de 50 na biblioteca de anúncios
Pesquisadores encontraram mais de 50 anúncios pagos com CSAM gerado por IA na biblioteca de anúncios do Meta, alguns alcançando milhares de contas. O Meta os removeu após questionamento da WIRED.

Injeção de Autoridade de Ferramentas em Agentes LLM: Quando a Saída da Ferramenta Sobrepõe a Intenção do Sistema
Um pesquisador demonstra 'Injeção de Autoridade de Ferramenta' em um laboratório local de agentes LLM, mostrando como a saída confiável de ferramentas pode ser elevada ao nível de autoridade de política, alterando silenciosamente o comportamento do agente enquanto a sandbox e o acesso a arquivos permanecem seguros.

Nova Habilidade Automatiza o Endurecimento de Segurança do OpenClaw em Servidores Remotos
Um desenvolvedor da comunidade lançou uma habilidade que ajuda assistentes de IA a proteger automaticamente instalações do OpenClaw em servidores remotos.

Axios 1.14.1 comprometido com malware, mira fluxos de trabalho de desenvolvimento assistido por IA
A versão 1.14.1 do Axios foi comprometida em um ataque à cadeia de suprimentos que silenciosamente incorpora [email protected], um dropper de RAT ofuscado. Desenvolvedores que usam assistentes de codificação com IA, como o Claude, devem verificar imediatamente seus arquivos de bloqueio e máquinas em busca de infecção.