Les filigranes de l'IA seront toujours triviaux à supprimer

L'article 50 de la loi européenne sur l'IA, applicable à partir d'août 2026, exige que les fournisseurs de LLM filigranent les textes générés par IA. Mais le filigranage de texte est un tout autre défi que le filigranage d'image — et le retirer reste trivial. Voici la ventilation technique.
Pourquoi le filigranage de texte est difficile
Les images ont du bruit dans lequel on peut cacher des filigranes ; le texte n'en a pas. On ne peut pas modifier une phrase sans qu'un humain ne le remarque. Cela en fait un problème de stéganographie où le texte en clair ne peut pas être manipulé arbitrairement. Une approche naïve comme « chaque cinquième lettre est un 'e' » compromettrait la qualité de sortie.
Le modèle lui-même pourrait-il jongler avec le filigrane ? Les modèles forts le peuvent, mais cela brûle des jetons de raisonnement et dégrade la qualité de sortie — un mauvais compromis.
Pourquoi la détection via ré-exécution du modèle échoue
Passer le texte dans le modèle pour vérifier les probabilités des jetons ne fonctionne pas : l'espace du texte humain qui ressemble à une sortie d'IA est énorme, les faux positifs abondent, et c'est prohibitif pour que chaque citoyen de l'UE puisse obtenir une vérification gratuite.
Comment fonctionne SynthID
SynthID de Google est le seul filigrane textuel public. Il attribue à chaque jeton un score basé sur les jetons précédents — par exemple, la somme des identifiants de jetons modulo 5. Lors de l'échantillonnage, le modèle choisit le jeton avec le score le plus élevé parmi les cinq options les plus probables. La détection agrège le score sur un bloc de texte ; un score agrégé suspectement élevé signale une génération par IA.
C'est comme l'heuristique du tiret cadratin, mais basée sur des motifs mathématiques subtils que les humains ne peuvent pas repérer.
Le piège
Mais tout filigrane qui préserve la diversité lexicale est supprimable par une simple paraphrase, une substitution de jetons, ou même une traduction. Tant que le texte doit se lire naturellement, on peut retirer le signal avec un effort minimal. La robustesse de SynthID est limitée — il est conçu pour une détection de masse, pas pour résister à un retrait délibéré.
Attendez-vous à ce que l'UE impose une exigence techniquement insatisfaisable. Les laboratoires s'y conformeront à la lettre, mais quiconque s'en soucie peut le contourner en quelques secondes.
📖 Lire la source complète : HN AI Agents
👀 See Also

Deux projets de recherche remettent en cause l'apprentissage par imitation pour les agents web
Deux projets de recherche démontrent les limites de l'entraînement par imitation seule pour les agents web : 'Browser in the Loop' utilise l'apprentissage par renforcement avec un modèle de 8 milliards de paramètres pour améliorer le succès de la soumission de formulaires, tandis que 'Concentrate or Collapse' montre que l'apprentissage par renforcement standard échoue avec les modèles de langage par diffusion, nécessitant une optimisation au niveau de la séquence.

Rapport Anthropique sur l'Intensité de l'Adoption de l'IA à l'Échelle Mondiale
Les dernières données d'Anthropic révèlent une adoption inégale de l'IA à l'échelle mondiale, mesurant l'intensité d'utilisation plutôt que le nombre total d'utilisateurs. Le rapport montre où l'IA est intégrée dans les flux de travail comme le codage, la recherche et la prise de décision, tant pour les individus que pour les entreprises.

Google signe un contrat classifié avec le Pentagone pour une utilisation « licite » de l'IA
Google aurait signé un accord classé permettant au ministère américain de la Défense d'utiliser ses modèles d'IA à toute fin gouvernementale légale, avec des restrictions sur la surveillance de masse et les armes autonomes uniquement comme un accord non contraignant.

ICML 2026 rejette 2 % des articles sur le bureau pour violation de la politique de révision par LLM.
ICML 2026 a rejeté 497 articles (environ 2 % des soumissions) après avoir détecté 795 évaluations (environ 1 % de toutes les évaluations) où les évaluateurs ont violé des accords explicites de ne pas utiliser de LLM. La méthode de détection impliquait le tatouage numérique des PDF avec des instructions LLM cachées.