Fonctionnement du tatouage de texte par IA : clés secrètes, choix de mots verts/rouges et détection
Le filigrane des textes IA fonctionne en dissimulant des marques dans le choix des mots, pas dans le texte lui-même. Google filigrane les textes de l'app et du web Gemini depuis 2024, et les modèles Claude marquent le texte au niveau du modèle depuis août 2026. Les marques survivent au copier-coller et sont invisibles pour les lecteurs.
Filigranage par biais de choix de mots
Lorsqu'un modèle de langage écrit, il choisit chaque mot en lançant des dés pondérés sur une liste de candidats. Le filigrane utilise une clé secrète pour colorer ces candidats en vert ou en rouge, puis pousse légèrement les dés vers le vert. Le texte reste naturel — les mots rouges peuvent encore gagner, mais moins souvent.
Comment fonctionne la détection
Avec la clé secrète, vous pouvez recolorer n'importe quel texte et compter combien de mots sont verts. Dans un texte non marqué, environ la moitié des mots seront verts par hasard. Dans un texte filigrané, le nombre est nettement plus élevé. Le détecteur ne lit pas le texte — il compte simplement les mots verts sur une durée suffisamment longue.
Ce que l'édition fait à la marque
Le filigrane vit dans des suites de mots non modifiés. La couleur de chaque mot est dérivée d'une courte fenêtre de mots précédents, donc l'édition efface la marque exactement là où la suite se brise. Les textes courts sont difficiles à évaluer — un document de 1 500 mots avec une légère inclinaison signalerait seulement ~55% de vert, c'est pourquoi les textes plus longs sont plus fiables.
Schémas de production
- SynthID de Google : Utilise un tournoi secret au lieu d'une simple poussée, préservant les probabilités exactes des mots.
- Schéma d'Aaronson : Dérive les lancers de dés eux-mêmes de la clé.
- Kirchenbauer et al. (2023) : L'approche classique du biais vert/rouge.
Consultez le guide visuel interactif pour une démonstration pratique du processus.
📖 Lire la source complète : HN AI Agents
👀 See Also

LiteLLM v1.82.8 Compromise Utilise un Fichier .pth pour une Exécution Persistante
LiteLLM v1.82.8 a été compromis sur PyPI et inclut un fichier .pth qui exécute du code arbitraire à chaque démarrage d'un processus Python, pas seulement lorsque la bibliothèque est importée. La charge utile s'exécute même si LiteLLM est installé comme dépendance transitive et jamais utilisé directement.

L'évaluation de l'AISI démontre les capacités cybernétiques de Claude Mythos Preview dans les CTF et les attaques multi-étapes.
L'Institut de Sécurité de l'IA a évalué la version préliminaire de Claude Mythos d'Anthropic, constatant qu'elle a réussi 73 % des défis de capture du drapeau de niveau expert et résolu une simulation d'attaque de réseau d'entreprise en 32 étapes dans 3 tentatives sur 10.

Une modification de SKILL.md est un changement de production — même lorsqu'aucun code n'a changé.
Les compétences d'espace de travail dans OpenClaw peuvent remplacer les versions groupées et modifier le comportement des agents. Traitez les fichiers SKILL.md comme du code de confiance — auditez-les et versionnez-les comme des changements de production.

Enveloppe de Contenu Externe d'OpenClaw pour la Défense contre l'Injection d'Invites
OpenClaw utilise un emballeur de contenu externe qui étiquette automatiquement les résultats de recherche web, les réponses d'API et les contenus similaires avec des avertissements indiquant qu'ils ne sont pas fiables, préparant le LLM à être sceptique et plus enclin à refuser des instructions malveillantes.