Fonctionnement du tatouage de texte par IA : clés secrètes, choix de mots verts/rouges et détection
Le filigrane des textes IA fonctionne en dissimulant des marques dans le choix des mots, pas dans le texte lui-même. Google filigrane les textes de l'app et du web Gemini depuis 2024, et les modèles Claude marquent le texte au niveau du modèle depuis août 2026. Les marques survivent au copier-coller et sont invisibles pour les lecteurs.
Filigranage par biais de choix de mots
Lorsqu'un modèle de langage écrit, il choisit chaque mot en lançant des dés pondérés sur une liste de candidats. Le filigrane utilise une clé secrète pour colorer ces candidats en vert ou en rouge, puis pousse légèrement les dés vers le vert. Le texte reste naturel — les mots rouges peuvent encore gagner, mais moins souvent.
Comment fonctionne la détection
Avec la clé secrète, vous pouvez recolorer n'importe quel texte et compter combien de mots sont verts. Dans un texte non marqué, environ la moitié des mots seront verts par hasard. Dans un texte filigrané, le nombre est nettement plus élevé. Le détecteur ne lit pas le texte — il compte simplement les mots verts sur une durée suffisamment longue.
Ce que l'édition fait à la marque
Le filigrane vit dans des suites de mots non modifiés. La couleur de chaque mot est dérivée d'une courte fenêtre de mots précédents, donc l'édition efface la marque exactement là où la suite se brise. Les textes courts sont difficiles à évaluer — un document de 1 500 mots avec une légère inclinaison signalerait seulement ~55% de vert, c'est pourquoi les textes plus longs sont plus fiables.
Schémas de production
- SynthID de Google : Utilise un tournoi secret au lieu d'une simple poussée, préservant les probabilités exactes des mots.
- Schéma d'Aaronson : Dérive les lancers de dés eux-mêmes de la clé.
- Kirchenbauer et al. (2023) : L'approche classique du biais vert/rouge.
Consultez le guide visuel interactif pour une démonstration pratique du processus.
📖 Lire la source complète : HN AI Agents
👀 See Also

OpenClaw Durcissement de la Sécurité : Protection Multi-couches Contre les Risques des Agents Autonomes
Un développeur a modifié la base de code d'OpenClaw pour ajouter une pile de sécurité multicouche comprenant une protection regex à refus catégorique, un désobfuscateur récursif, un profil AppArmor et une intégration d'audit afin d'empêcher les commandes destructrices et l'exfiltration de données par des agents autonomes.

Code source de Cisco volé via une attaque de chaîne d'approvisionnement Trivy
L'environnement de développement interne de Cisco a été compromis à l'aide d'identifiants volés lors de l'attaque de la chaîne d'approvisionnement Trivy, entraînant le vol du code source de plus de 300 dépôts GitHub, y compris des produits alimentés par l'IA et du code client.

Vulnérabilités critiques de sécurité OpenClaw corrigées le 28.03.2026.
La version 2026.3.28 d'OpenClaw corrige 8 vulnérabilités de sécurité critiques découvertes par Ant AI Security Lab, incluant un contournement de sandbox, une élévation de privilèges et des risques SSRF. Les utilisateurs sur des versions ≤2026.3.24 doivent mettre à jour immédiatement.

Sécurité OpenClaw : 13 étapes pratiques pour sécuriser votre agent IA
Un post Reddit détaille 13 mesures de sécurité pour les installations OpenClaw, notamment l'exécution sur une machine séparée, l'utilisation de Tailscale pour l'isolation réseau, le confinement des sous-agents dans Docker et la configuration de listes d'autorisation pour l'accès des utilisateurs.