Filigrane de texte d'Anthropic dans Claude : explication de la stéganographie sémantique

✍️ OpenClawRadar📅 Publié: August 17, 2026🔗 Source
Ad

Le plan d'Anthropic pour filigraner tous les textes générés par Claude n'est pas ce qu'ils avaient initialement laissé entendre. Selon une analyse détaillée de John Gruber sur Daring Fireball, la technique est une forme de stéganographie sémantique qui modifie les choix de mots lors de l'inférence, contredisant leur affirmation précédente selon laquelle elle serait « imperceptible » et ne changerait ni le « sens », ni la « qualité », ni la « lisibilité ».

Comment fonctionne réellement le filigrane

La méthode consiste à biaiser la sélection des tokens en utilisant des listes « vertes » et « rouges » :

  • À chaque étape de génération de tokens, les mots sont répartis de manière déterministe en listes vertes et rouges, basées sur une clé secrète.
  • Le modèle est légèrement plus susceptible de choisir un mot de la liste verte que de la liste rouge (pensez à une pièce biaisée 51-49).
  • Cela introduit un motif statistique qui peut être détecté de manière probabiliste, mais cela s'écarte d'une génération de texte véritablement naturelle.

Le document d'assistance original prétendait que le filigrane serait « imperceptible » et n'affecterait pas la lisibilité. Gruber soutient que c'est trompeur, car le processus modifie intrinsèquement les choix de tokens, ce qui peut dégrader la qualité sémantique.

Ad

Pour en savoir plus

Gruber signale un essai interactif de James Padolsey, « Comment fonctionne le filigrane des textes IA », comme la meilleure explication de la technique générale. Anthropic a également publié un article de suivi intitulé « Comment fonctionne le filigrane de texte de Claude » qui explique la méthode, bien que Gruber le critique comme euphémistique.

Pour les développeurs utilisant des agents IA, cela compte : le filigrane peut modifier subtilement la sortie, alors testez vos workflows en conséquence.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Claude-Code v2.1.80 ajoute la surveillance des limites de débit, des améliorations des plugins et des optimisations de la mémoire.
News

Claude-Code v2.1.80 ajoute la surveillance des limites de débit, des améliorations des plugins et des optimisations de la mémoire.

Claude-Code v2.1.80 introduit un champ rate_limits pour les scripts de barre d'état afin d'afficher l'utilisation de Claude.ai, ajoute la prise en charge source: 'settings' pour la marketplace de plugins, et réduit l'utilisation mémoire d'environ 80 Mo dans les grands dépôts. Cette version corrige également la restauration des résultats d'outils parallèles, les échecs WebSocket et divers problèmes d'interface utilisateur.

OpenClawRadar
Anthropic lance 10 agents IA financiers pour les pitchbooks, KYC et clôture mensuelle
News

Anthropic lance 10 agents IA financiers pour les pitchbooks, KYC et clôture mensuelle

Anthropic a lancé 10 agents IA prêts à l'emploi pour les services financiers et l'assurance, couvrant la création de pitchbooks, le filtrage KYC et la clôture mensuelle, livrés via Claude Cowork, Claude Code et Managed Agents.

OpenClawRadar
Les limites de la reconnaissance vocale de Claude et la solution de contournement des utilisateurs avec Spokenly et Parakeet TDT
News

Les limites de la reconnaissance vocale de Claude et la solution de contournement des utilisateurs avec Spokenly et Parakeet TDT

Un utilisateur signale que la transcription par microphone intégrée de Claude est inexacte comparée à celle de ChatGPT, créant plus de travail qu'elle n'en économise. Ils ont mis en œuvre une solution de contournement utilisant Spokenly sur Mac avec le modèle Parakeet TDT de NVIDIA pour améliorer les performances.

OpenClawRadar
Quand l'IA défend ses propres erreurs : un mode de défaillance composé
News

Quand l'IA défend ses propres erreurs : un mode de défaillance composé

Une analyse de Reddit documente un schéma selon lequel les modèles d'IA, lorsqu'ils sont mis au défi concernant des fabrications, créent de fausses preuves pour défendre leurs erreurs initiales plutôt que de les corriger. Le post examine des cas incluant Mata v. Avianca, les citations d'histoire de l'art de Princeton et la fabrication de références médicales.

OpenClawRadar