- Depuis le 2 août 2026, Anthropic marque les sorties texte de Claude. Google le fait depuis 2024 avec SynthID. Ce n'est pas un hasard de calendrier, c'est la date d'entrée en application de l'article 50 de l'AI Act.
- Un watermark de texte n'est ni une balise, ni une métadonnée, ni un logo. C'est un biais statistique introduit pendant la génération, au moment où le modèle choisit chaque mot.
- La détection n'est pas une lecture, c'est un test statistique. Elle exige de la longueur, et SynthID-Text n'atteint qu'environ 30 % de détection à 50 tokens.
- Point décisif, le marquage est first-party. Chaque éditeur ne détecte que sa propre marque, avec sa propre clé privée. Personne ne détecte celle des autres.
Début août, Anthropic a publié une page de documentation où l'on apprend que Claude marque désormais ses sorties. Dans la foulée, plusieurs articles ont ressorti SynthID, le système équivalent chez Google, avec des titres alarmants sur ce que ça changerait pour le référencement. Je réponds à cette question dans un article séparé. Elle appelle une réponse nette, et elle n'a rien à voir avec la mécanique.
Ici, je veux juste expliquer comment ça marche. La plupart des commentaires que j'ai lus décrivent un mécanisme qui n'existe pas, une sorte de tatouage caché dans le fichier qu'un moteur lirait au passage. La réalité est plus élégante, et bien plus limitée. Une fois qu'on l'a comprise, la moitié des inquiétudes tombent toutes seules.
Le problème que ça cherche à résoudre
Avant les watermarks, on ne pouvait que deviner si un texte venait d'une IA. C'est ce que font les détecteurs classiques, des classifieurs entraînés à repérer des régularités de style, une perplexité faible, des phrases trop régulières, un vocabulaire lissé. Ça marche mal. Et ça produit des faux positifs qui tombent toujours sur les mêmes profils, ceux des rédacteurs appliqués, des locuteurs non natifs, des textes techniques. Un texte humain bien écrit ressemble statistiquement à un texte de machine.
Le watermarking prend le problème par l'autre bout. Au lieu d'analyser le texte après coup pour deviner son origine, on intervient pendant sa production pour y laisser une signature volontaire. On ne cherche plus à reconnaître un style, on cherche une empreinte qu'on a soi-même déposée. C'est la différence entre l'expertise graphologique et le filigrane dans le papier.
Le principe : biaiser le choix des mots
Pour comprendre le mécanisme, il faut savoir comment un modèle de langage produit du texte. Il ne raisonne pas en mots mais en tokens, des fragments qui valent souvent une syllabe ou un morceau de mot. À chaque étape, il ne désigne pas directement le token suivant. Il attribue un score à chacun des tokens de son vocabulaire, convertit ces scores en probabilités, puis tire dedans. Ces vocabulaires sont énormes, 128 256 tokens pour Llama 3, 256 000 pour Gemma. Après « le chat dort sur le », des candidats comme canapé, lit, tapis, rebord ont tous une probabilité respectable.
Une précision qui servira plus loin. Ce tirage n'a lieu que si le modèle est réglé pour. En décodage glouton, à température zéro, il prend simplement le token le mieux noté. Ça sépare les deux familles de watermarks décrites plus bas. Celle qui modifie les scores avant le tirage fonctionne encore en décodage glouton ; celle qui organise un tournoi entre candidats tirés au sort a besoin d'un échantillonnage.
C'est cette marge de manœuvre qu'exploite le watermarking. Quand plusieurs tokens conviennent, on peut pousser discrètement le choix vers un sous-ensemble désigné par une clé secrète. Ce sous-ensemble n'a rien de figé, il est recalculé à chaque étape à partir du contexte immédiat, ce qui interdit d'en dresser la liste une fois pour toutes. Sur un token, c'est invisible et sans effet. Sur des centaines, ça produit un écart statistique mesurable, et le texte contient bien plus de tokens « attendus par la clé » que ne le voudrait le hasard.
La première méthode : liste verte, liste rouge
La méthode fondatrice est celle de Kirchenbauer et ses coauteurs, publiée en 2023. Elle reste la référence pédagogique parce qu'elle est simple à décrire :
- Au moment de choisir un token, on prend en compte le ou les tokens précédents, et on les combine à une clé secrète via une fonction de hachage.
- Ce hash sert de graine pour partitionner pseudo-aléatoirement tout le vocabulaire en deux, une « liste verte » et une « liste rouge ».
- On ajoute un petit bonus, noté δ, aux scores des tokens verts, ce qui augmente leur probabilité d'être tirés.
- On échantillonne normalement. Le modèle reste libre, et si un mot rouge est nettement meilleur, il gagne quand même.
Ce qui compte ici, c'est que la partition change à chaque token, puisqu'elle dépend du contexte précédent. Il n'existe donc aucune « liste de mots IA » qu'on pourrait publier ou contourner. La liste verte du mot 47 n'a rien à voir avec celle du mot 48.
Pour détecter, on rejoue l'opération. Connaissant la clé, on recalcule la partition à chaque position et on compte combien de tokens sont verts. Sur un texte non marqué, on attend environ la moitié. Nettement plus, et on rejette l'hypothèse du hasard.
La méthode de Google : le tournoi
SynthID-Text, décrit par DeepMind dans Nature, raffine considérablement cette idée. Le mécanisme s'appelle le tournament sampling, et il fonctionne comme un tournoi à élimination directe :
- À chaque étape, une graine est calculée à partir des H tokens précédents et d'une clé secrète.
- Cette graine sert à attribuer à chaque token candidat une valeur pseudo-aléatoire, la g-value.
- On tire 2m candidats, qu'on apparie deux à deux, et à chaque manche le token dont la g-value est la plus élevée l'emporte.
- Après m couches d'élimination, un seul survivant reste. C'est lui qui est écrit.
L'idée est de répartir le signal sur plusieurs couches au lieu de le concentrer dans un seul biais. Le watermark gagne en robustesse sans abîmer le texte davantage.
Comment on détecte, concrètement
La détection n'est pas une lecture, c'est un test d'hypothèse. On recalcule les g-values sur le texte suspect et on agrège. Deux scores coexistent dans la littérature :
- le Mean Score, simple moyenne des g-values sur tous les tokens et toutes les couches ;
- le Bayesian Score, qui formule explicitement le choix entre « marqué » et « non marqué » sous forme de probabilités a posteriori.
Dans les deux cas, la sortie n'est pas un oui ou un non, mais un score comparé à un seuil, avec un taux de faux positifs assumé, typiquement 1 %. Premier signe que ce mécanisme n'a rien d'un identifiant. Il produit une présomption, pas une preuve.
Le périmètre exact du marquage d'Anthropic
La documentation d'Anthropic distingue deux dispositifs bien différents.
Pour le texte, un watermark imperceptible « tissé directement dans le texte lui-même », qui ne change « ni le sens, ni la qualité, ni la lisibilité ». Il « voyage avec le texte quand on le copie-colle, et peut persister à travers certaines éditions ». Anthropic ne précise pas la méthode employée, mais la description correspond à la famille décrite plus haut.
Pour les fichiers (SVG, PNG, JPG), c'est tout autre chose, des métadonnées de provenance signées au standard ouvert C2PA. Là, on est dans un mécanisme classique d'en-tête de fichier, qui enregistre l'origine et permet de détecter une altération, et qui, comme tout en-tête, disparaît à la moindre conversion.
Le périmètre couvre Claude Platform (API), Claude, Claude Code, Claude Cowork et Claude Tag. Les modèles antérieurs au 2 août 2026 sont rattrapés progressivement.
Les limites, à commencer par la longueur du texte
C'est la partie que les articles d'actualité sautent, et celle qui permet de juger la portée réelle du dispositif.
La longueur est éliminatoire. Un test statistique a besoin d'échantillon. Un travail d'analyse de SynthID-Text mesure environ 30 % de vrais positifs à 50 tokens, soit à peine mieux qu'un tirage à pile ou face légèrement biaisé. Les protocoles sérieux travaillent à partir de 100 tokens. Un titre, une méta-description, un paragraphe court restent hors de portée.
L'édition dégrade le signal. Anthropic l'écrit noir sur blanc, les marques peuvent disparaître si le texte est « fortement édité, paraphrasé, traduit, ou mélangé à d'autres écrits ». Côté SynthID, les auteurs reconnaissent « une dégradation modérée des performances dans les scénarios adverses tels que les attaques par paraphrase ». Aucun de ces systèmes n'offre de garantie de robustesse à la réécriture.
Le mécanisme est attaquable. Le même papier décrit une attaque par inflation de couches qui fait chuter le taux de détection du Mean Score d'environ 85 % à 13-16 %, soit 87 % des textes marqués reclassés comme non marqués. Ce n'est pas une faille théorique lointaine, c'est une démonstration publiée.
Les métadonnées de fichier s'effacent trivialement. Anthropic liste les vecteurs, conversion de format, ré-enregistrement, capture d'écran. Toute chaîne de publication qui redimensionne ou recompresse une image détruit le C2PA sans le vouloir.
Le marquage est first-party : chacun ne lit que le sien
Je ne l'ai lue dans aucun article français, et elle conditionne tout le reste.
Un watermark de texte ne se détecte qu'avec la clé qui l'a produit. Les clés de SynthID sont privées, si bien que seul Google peut vérifier une signature SynthID. Seul Anthropic peut vérifier celle de Claude. SynthID est explicitement un outil de provenance first-party, pas un détecteur universel. Il ne sait pas reconnaître le contenu généré par d'autres fournisseurs, et ne le prétend pas. Microsoft et Meta ont développé leurs propres systèmes, incompatibles.
En clair, personne ne peut savoir, de l'extérieur, quel modèle a écrit un texte. Pas « c'est difficile ». C'est impossible sans la coopération de celui qui détient la clé.
Pourquoi tout le monde s'y est mis le même jour
La date du 2 août 2026 dans la documentation d'Anthropic n'est pas un choix produit. C'est l'entrée en application de l'article 50 de l'AI Act, qui impose aux fournisseurs de systèmes d'IA générative que les sorties soient « marquées dans un format lisible par machine et détectables comme artificiellement générées ».
Ça change la lecture de l'annonce. Ce n'est pas un geste de transparence spontané, ni une manœuvre concurrentielle. C'est une mise en conformité, livrée le jour de l'échéance. Ce qui explique aussi pourquoi le dispositif est calibré au minimum. Marquer, oui ; rendre la marque lisible par les autres, non.
Ce qu'il faut retenir
- Le watermarking de texte est un biais statistique déposé à la génération, pas une balise ajoutée au fichier.
- La détection est un test de probabilité qui exige de la longueur et rend un verdict nuancé, jamais binaire.
- Il est fragile, puisque la réécriture, la traduction, le mélange et même une attaque documentée le neutralisent.
- Il est first-party, chacun ne lisant que sa propre marque. C'est le point qui désamorce la quasi-totalité des scénarios catastrophes qu'on lit en ce moment.
- Il existe parce que la loi l'impose depuis le 2 août 2026, pas parce que le marché le demandait.
Reste la vraie question, celle des conséquences pour qui publie du contenu assisté par IA. Elle est traitée ici, dans non, le watermarking IA ne va pas pénaliser votre référencement.
Sources
- Anthropic | How Claude marks AI-generated content - la documentation officielle : périmètre, technologies, limites reconnues.
- Nature | Scalable watermarking for identifying large language model outputs - le papier DeepMind décrivant SynthID-Text et le tournament sampling.
- arXiv | On Google's SynthID-Text LLM Watermarking System: Theoretical Analysis and Empirical Validation - analyse critique : scores de détection, seuils, et l'attaque par inflation de couches.
- AI Act | Article 50 - Transparency Obligations - le texte des obligations de marquage, applicables au 2 août 2026.
- GitHub | google-deepmind/synthid-text - l'implémentation de référence.
- Non, le watermarking IA ne va pas pénaliser votre SEO - l'analyse des conséquences réelles.
- Google sanctionne la manipulation des réponses IA - ce que Google punit vraiment.
- Comment ChatGPT choisit ses sources - la mécanique de sélection, côté citation.
- Le RAG expliqué - l'autre moitié du fonctionnement des moteurs génératifs.
L'auteur de cette page
Éditeur de sites et consultant SEO, spécialisé en GEO. Drôme, France.
Josselin Leydier a mis en ligne son premier site en 2006 et en édite aujourd'hui environ 200, qui lui servent de terrain de test en conditions réelles. Il est consultant SEO senior chez Semjuice. Il tient LLM-GEO.fr, une bibliothèque d'études sur le GEO où chaque chiffre est vérifié dans sa source primaire avant d'être relayé, et où les limites de chaque étude sont documentées.
En savoir plus sur l'auteur · Le contacter · Toutes les études GEO