Fonctionnement du tatouage de texte par IA : clés secrètes, choix de mots verts/rouges et détection
Le filigrane des textes IA fonctionne en dissimulant des marques dans le choix des mots, pas dans le texte lui-même. Google filigrane les textes de l'app et du web Gemini depuis 2024, et les modèles Claude marquent le texte au niveau du modèle depuis août 2026. Les marques survivent au copier-coller et sont invisibles pour les lecteurs.
Filigranage par biais de choix de mots
Lorsqu'un modèle de langage écrit, il choisit chaque mot en lançant des dés pondérés sur une liste de candidats. Le filigrane utilise une clé secrète pour colorer ces candidats en vert ou en rouge, puis pousse légèrement les dés vers le vert. Le texte reste naturel — les mots rouges peuvent encore gagner, mais moins souvent.
Comment fonctionne la détection
Avec la clé secrète, vous pouvez recolorer n'importe quel texte et compter combien de mots sont verts. Dans un texte non marqué, environ la moitié des mots seront verts par hasard. Dans un texte filigrané, le nombre est nettement plus élevé. Le détecteur ne lit pas le texte — il compte simplement les mots verts sur une durée suffisamment longue.
Ce que l'édition fait à la marque
Le filigrane vit dans des suites de mots non modifiés. La couleur de chaque mot est dérivée d'une courte fenêtre de mots précédents, donc l'édition efface la marque exactement là où la suite se brise. Les textes courts sont difficiles à évaluer — un document de 1 500 mots avec une légère inclinaison signalerait seulement ~55% de vert, c'est pourquoi les textes plus longs sont plus fiables.
Schémas de production
- SynthID de Google : Utilise un tournoi secret au lieu d'une simple poussée, préservant les probabilités exactes des mots.
- Schéma d'Aaronson : Dérive les lancers de dés eux-mêmes de la clé.
- Kirchenbauer et al. (2023) : L'approche classique du biais vert/rouge.
Consultez le guide visuel interactif pour une démonstration pratique du processus.
📖 Lire la source complète : HN AI Agents
👀 See Also

Blocage Essentiel des Fichiers pour les Assistants de Codage IA : Une Liste de Contrôle de Sécurité Pratique
Les assistants de codage IA lisent depuis votre disque local, pas seulement depuis votre dépôt, exposant des fichiers que .gitignore protège de GitHub mais pas de l'agent. Une discussion Reddit identifie les fichiers critiques à bloquer, y compris les configurations d'assistant IA avec des clés API, les identifiants de service, les clés SSH et les fichiers d'environnement.

Agent-Drift : Outil de surveillance de sécurité pour agents IA
Aucun

ClawSecure : Plateforme de Sécurité pour l'Écosystème OpenClaw avec Audit à 3 Niveaux et Surveillance en Temps Réel
ClawSecure est une plateforme de sécurité dédiée à OpenClaw qui effectue des audits de sécurité à 3 niveaux, une surveillance en temps réel avec suivi des hachages SHA-256 toutes les 12 heures, et offre une couverture complète OWASP ASI. Elle a audité plus de 3 000 compétences populaires et est gratuite sans inscription requise.

La fonctionnalité d'utilisation informatique d'Anthropic déclenche un verrouillage de gouvernance lors d'un test réel
Anthropic a déployé des capacités d'utilisation informatique, et lors de la mise en œuvre des contrôles de gouvernance, un seuil de risque a déclenché une posture de VERROUILLAGE qui a bloqué toutes les opérations de mutation, y compris les travaux de gouvernance de l'opérateur lui-même.