LLM-GEO.fr
veille en direct FR / EN

Blog | Prise de positionContenu IA et classementAoût 2026

Non, le watermarking IA ne va pas pénaliser votre référencement

Publié le 11 août 2026 Sources : Google Search Central, Nature, arXiv, AI Act Lecture : ~11 min Analyse : Josselin Leydier
  • La thèse qui circule : Google utiliserait SynthID pour repérer les contenus générés par IA et les déclasser, lors d'un futur update surnommé « Watermark Panda ».
  • Elle ne tient pas, pour trois raisons : Google ne peut techniquement pas lire le marquage des autres fournisseurs ; l'incitation économique tourne à l'envers ; et le signal serait trop instable pour un système de classement.
  • La doctrine publiée de Google n'a pas bougé depuis 2023. Ce qui compte est la qualité, pas le mode de production. Ce qui est sanctionné, c'est l'intention de manipuler.
  • Le vrai enjeu est réglementaire, pas algorithmique. L'article 50 §4 de l'AI Act impose une divulgation à certains éditeurs, avec une exemption qui vide l'obligation de sa substance pour le texte.

Depuis qu'Anthropic a documenté le marquage de Claude, début août, une thèse s'est installée à toute vitesse. Les moteurs vont pouvoir repérer les contenus produits par IA, et ils vont s'en servir pour les déclasser. Un article très partagé pousse le raisonnement jusqu'à baptiser l'événement à venir « Watermark Panda », en référence à la mise à jour qui avait balayé les fermes de contenu en 2011.

C'est une bonne histoire. Elle est fausse. Et elle coûte cher. Elle pousse des équipes à réécrire à la main des contenus qui n'en avaient aucun besoin, et elle détourne l'attention du sujet réellement en jeu, qui est réglementaire.

Si la mécanique du marquage ne vous est pas familière, je l'explique en détail dans l'article qui accompagne celui-ci. Ce qui suit s'appuie dessus.

Un exposé technique solide, avec ses propres réserves

Sur la technique, l'article est solide. Il décrit bien le logits processor, le fait que SynthID module les probabilités de sélection des mots, et son extension aux images, à l'audio et à la vidéo. Le chiffre de plus de dix milliards de contenus marqués vient bien de DeepMind.

Le problème est ailleurs. Le titre vend une menace que le corps du texte dément lui-même. On y lit, en toutes lettres (je traduis, les formulations d'origine sont en anglais) :

« Google n'a pas confirmé si les signaux SynthID alimentent aujourd'hui l'algorithme de classement. »

Et sur le lien avec le Core Update de mars 2026, qu'il présente comme la preuve d'une trajectoire :

« Il ne nomme pas spécifiquement les signaux SynthID, mais la trajectoire est claire. »

Traduction. Rien ne relie cet update à SynthID, mais on les relie quand même. Quant au « Watermark Panda », il arrive au conditionnel, avec un « si un futur core update intégrait les signaux SynthID… ». C'est une hypothèse de l'auteur, habillée en avertissement.

Ce n'est pas de la désinformation, et je ne le traite pas comme tel. L'article pose ses réserves, honnêtement, dans le corps du texte. Mais il les enterre sous un titre qui produit l'effet inverse. C'est très répandu dans notre secteur. Une spéculation habillée en alerte, défendable ligne à ligne, trompeuse à la lecture. Sauf qu'ici, les faits permettent de trancher.

Raison 1 : Google ne peut pas lire le marquage des autres

C'est l'objection décisive, et elle est technique, pas rhétorique.

Un watermark de texte ne se détecte qu'avec la clé qui l'a produit. Les clés de SynthID sont privées, si bien que seul Google peut vérifier une signature SynthID. À l'inverse, seul Anthropic peut vérifier celle de Claude. SynthID est un outil de provenance first-party. Il ne prétend pas reconnaître le contenu des autres fournisseurs, et il ne le fait pas. Microsoft et Meta ont bâti leurs propres systèmes, incompatibles avec les précédents.

Cette raison a une date de péremption, et je préfère le dire tout de suite. Google a annoncé signer le Code of Practice de l'AI Act sur la transparence des contenus générés, dont le texte a été publié le 24 juillet 2026, et travailler avec « Apple, Eleven Labs, Kakao, NVIDIA, and OpenAI » pour « drive industry-wide adoption of interoperable watermarking tools using SynthID ». Le cloisonnement que je décris est donc un état de fait daté, pas une loi de la nature, et les acteurs travaillent ouvertement à le lever. Google ne précise pas si ces partenariats couvrent le texte ou seulement l'image, l'audio et la vidéo. À suivre de près, c'est le point qui bougera le plus vite.

Donc, si votre contenu a été rédigé avec Claude, ChatGPT, Mistral ou Llama, Google n'a aucun moyen de le savoir par le watermark. Pas « c'est compliqué ». Il n'a pas la clé, et personne n'est tenu de la lui donner.

Il y a même plus radical. OpenAI n'a jamais déployé de watermark sur le texte de ChatGPT. Pas par retard technique. L'entreprise a développé une méthode, l'a jugée très efficace, et a choisi de ne pas la mettre en service. Sur l'assistant le plus utilisé au monde, il n'y a tout simplement rien à détecter.

Pourquoi OpenAI a renoncé. D'après les éléments rapportés par la presse à partir de documents internes, deux motifs. Les utilisateurs interrogés déclaraient qu'ils se serviraient moins de ChatGPT si ses sorties devenaient traçables, et l'entreprise redoutait de stigmatiser les locuteurs non natifs qui l'emploient comme aide légitime à la rédaction. C'est exactement le biais que produisent déjà les détecteurs stylométriques. Je donne ces motivations pour ce qu'elles sont, du reporting sur des documents internes, pas une déclaration officielle. Le fait, lui, n'est pas contesté. Rien n'est déployé sur le texte.

Mais ce « rien » ne va pas durer. L'article 50 §2 de l'AI Act impose aux fournisseurs de marquer les sorties, texte compris, et il s'applique depuis le 2 août 2026. OpenAI place ChatGPT sur le marché européen, donc l'obligation le vise. Plusieurs analyses font état d'une période transitoire jusqu'au 2 décembre 2026 pour les systèmes déjà commercialisés avant le 2 août ; je n'ai pas pu la recouper sur une source officielle, à prendre comme une indication et pas comme une date ferme.

Une réserve de taille demeure, et elle est écrite dans le texte lui-même. Le marquage doit être robuste « dans la mesure où cela est techniquement faisable, compte tenu des spécificités et des limites des différents types de contenus ». Or le texte est précisément le format où la robustesse est la plus faible, puisqu'une simple paraphrase suffit à effacer la marque. Cette clause est l'échappatoire naturelle pour le texte, et personne ne sait encore jusqu'où le régulateur l'acceptera.

Le seul contenu où Google retrouve sa propre marque, c'est celui qu'a produit Gemini. D'où la deuxième objection, plus amusante.

Raison 2 : l'incitation tourne à l'envers

SynthID marque les sorties de Gemini. Un produit que Google développe, promeut et vend, en abonnement comme en API, à des entreprises qui s'en servent précisément pour produire du contenu.

Le scénario du « Watermark Panda » revient donc à ceci. Google marque les sorties de son propre modèle. Il se sert ensuite de cette marque pour déclasser les contenus produits avec lui, pendant qu'une autre division de la maison en fait la promotion commerciale. Et un contenu rédigé avec un modèle concurrent, faute de clé, passe entre les mailles.

Ça pénaliserait ses propres clients tout en avantageant ceux de ses concurrents. Aucune entreprise ne construit ça.

L'argument vaut aussi dans l'autre sens. Si un tel signal existait et devenait connu, il créerait immédiatement un incitatif à fuir Gemini au profit de modèles non détectables par Google. Le marquage se transformerait en désavantage concurrentiel pour le produit qu'il équipe. C'est la raison pour laquelle je considère ce scénario comme structurellement improbable, et pas seulement comme non confirmé.

Raison 3 : le signal serait inexploitable

Admettons quand même, par pure hypothèse, que Google veuille s'en servir. Encore faudrait-il que le signal soit fiable. Il ne l'est pas.

  • Il exige de la longueur. SynthID-Text n'atteint qu'environ 30 % de détection à 50 tokens. Les tests sérieux commencent à 100 tokens. Une fiche produit, une méta-description, un paragraphe passent sous le radar.
  • Il ne survit pas à la réécriture. Anthropic reconnaît que ses marques disparaissent sur un texte « fortement édité, paraphrasé, traduit ou mélangé ». DeepMind admet une « dégradation modérée » face aux attaques par paraphrase. Or la quasi-totalité du contenu professionnel assisté par IA est édité.
  • Il est attaquable. Une attaque publiée fait chuter le taux de détection d'environ 85 % à 13-16 %.

Un signal de classement doit être stable, dur à manipuler, et utilisable à grande échelle. Celui-ci est instable, manipulable, et ne fonctionne que sur les textes longs et non retouchés, c'est-à-dire les moins nombreux. Il produirait surtout des faux négatifs en masse. Le contenu bâclé, souvent court et dupliqué, échapperait à la détection, tandis qu'un long article de fond écrit avec Gemini puis relu serait le plus exposé. L'inverse exact de l'effet recherché.

La position publiée de Google n'a pas bougé depuis février 2023

Inutile de spéculer, puisque la position est publiée. Elle n'a pas bougé depuis février 2023.

Google Search Central écrit que juger la qualité d'un contenu plutôt que sa méthode de production est un principe qui a fait ses preuves depuis des années. Un usage approprié de l'IA ou de l'automatisation ne contrevient pas aux consignes, et aucun contenu n'est pénalisé au seul motif qu'il a été généré par IA.

Ce qui est sanctionné est délimité au cordeau, et porte sur l'intention, celle d'automatiser dans le but principal de manipuler le classement. Produire en masse du contenu médiocre pour occuper la SERP, c'est du spam, que ce soit écrit par une IA, par une ferme de rédacteurs ou par un script de filage. Le mode de production n'est pas le critère. Il ne l'a jamais été.

C'est cohérent avec ce que Google a fait de plus récent. En mai 2026, il a étendu ses règles anti-spam à la manipulation des réponses IA. Là encore, la cible est la manipulation, pas l'outil.

L'enjeu est réglementaire : l'article 50 de l'AI Act

S'il y a une chose à surveiller cet été, ce n'est pas le classement. C'est le droit.

L'article 50 de l'AI Act ne parle pas qu'aux fournisseurs de modèles. Son paragraphe 4, deuxième alinéa, vise les déployeurs, c'est-à-dire les éditeurs. Il impose de divulguer qu'un texte a été généré ou manipulé artificiellement quand il est publié pour informer le public sur des questions d'intérêt public.

Lisez-la deux fois si vous éditez un site d'actualité, un média local, un magazine sectoriel ou un blog d'information. C'est vous que ça décrit, pas un laboratoire d'IA.

Mais l'exemption change presque tout. Le même alinéa écarte l'obligation quand le contenu est passé par une révision humaine ou un contrôle éditorial, et qu'une personne physique ou morale assume la responsabilité éditoriale de la publication. Un texte assisté par IA, relu, corrigé et publié sous la responsabilité d'un éditeur identifié échappe donc à la divulgation obligatoire. La ligne de partage n'est pas « IA ou pas IA ». C'est « y a-t-il quelqu'un qui répond du contenu ? ».

Je trouve cet arbitrage très bien vu, et il rejoint ce que je défends ici depuis le début. La vraie question n'a jamais été de savoir quel outil tenait le stylo, mais si quelqu'un a vérifié, tranché et engagé son nom. C'est aussi, accessoirement, ce qui sépare un contenu que les moteurs citent d'un contenu qu'ils ignorent.

Réserve. Je lis ici le texte de l'article 50, pas une décision de justice. Ce que recouvre exactement l'« intérêt public », et le niveau de relecture humaine attendu, seront précisés par les lignes directrices de la Commission et par la pratique. Si vous éditez à une échelle sérieuse, la question relève d'un conseil juridique, pas d'un article de blog. Ce que j'affirme, c'est que le vrai débat est là, et pas dans un hypothétique déclassement algorithmique.

Ce que je ferais, concrètement

  1. Ne réécrivez rien pour « effacer le watermark ». C'est du temps perdu contre un risque qui n'existe pas, et Google ne lit pas cette marque de toute façon.
  2. N'achetez pas d'outil de « détection de watermark ». Sans la clé privée du fournisseur, aucun prestataire tiers ne peut vérifier quoi que ce soit. Ce qui se vend sous ce nom relève au mieux du classifieur stylométrique, avec ses faux positifs.
  3. Vérifiez qui assume la responsabilité éditoriale de vos publications. Auteur identifié, page « à propos » réelle, mentions légales à jour, processus de relecture documenté. C'est utile pour l'AI Act, et ça l'était déjà pour l'E-E-A-T.
  4. Continuez à juger vos contenus sur ce qui compte : apport réel, données sourcées, sources citées, expertise nommée. Ces critères ne changent pas selon l'outil de rédaction.
  5. Sur les images, sachez que le C2PA saute à la moindre conversion ou recompression. Si vous tenez à conserver la provenance, ne repassez pas vos visuels dans une moulinette d'optimisation sans le savoir.

Ce qui me ferait changer d'avis

Voici ce qui démolirait ma position.

  • Une interopérabilité réelle des marquages, par un registre commun ou un échange de clés entre fournisseurs. J'avais d'abord rangé ce scénario dans le lointain. C'était une erreur d'appréciation, et je la corrige : il est déjà engagé. Google a signé le Code of Practice de l'AI Act sur la transparence et annonce travailler avec Apple, Eleven Labs, Kakao, NVIDIA et OpenAI à l'adoption d'outils de marquage interopérables via SynthID. Reste à savoir si le texte est concerné, ce que Google ne précise pas.
  • Une déclaration officielle de Google intégrant un signal de provenance à ses systèmes de classement. Rien de tel à ce jour, et la doctrine publiée dit l'inverse.
  • Une étude sérieuse établissant une corrélation entre présence d'un watermark détectable et perte de positions, à qualité contrôlée. Pas une observation de trafic. Un protocole. Rien de tel à ce jour.

Le premier point touche mon propre raisonnement. Si l'interopérabilité aboutit, la raison n°1 tombe. Les deux autres, elles, n'en dépendent pas. Un marquage parfaitement interopérable ne donnerait toujours aucune raison à Google de déclasser les contenus produits avec son propre modèle, et ne rendrait pas le signal plus stable face à la paraphrase. La thèse de cet article tient sur trois pieds, dont un seul est daté.

Je mettrai cet article à jour si l'un de ces éléments bouge, et je le dirai. En attendant, la réponse à « faut-il craindre le watermarking pour son SEO ? » est non, et le temps qu'on y consacre serait mieux employé à rendre les contenus dignes d'être cités.

Sources

Sources primaires

Sources secondaires, à recouper

  • Asia IP | OpenAI is hesitant to watermark ChatGPT-generated text - la non-mise en service du watermarking de texte chez OpenAI et les motifs rapportés. Le fait est concordant sur plusieurs sources ; les motivations proviennent de reporting sur documents internes.
  • La période transitoire au 2 décembre 2026 pour les systèmes déjà sur le marché avant le 2 août est rapportée par plusieurs analyses juridiques, sans que j'aie pu la confirmer sur un texte officiel. À vérifier avant d'en tirer une échéance opérationnelle.

Travaux scientifiques

La source discutée dans cet article

Pour aller plus loin sur le site :

L'auteur de cette page

Josselin Leydier

Éditeur de sites et consultant SEO, spécialisé en GEO. Drôme, France.

Josselin Leydier a mis en ligne son premier site en 2006 et en édite aujourd'hui environ 200, qui lui servent de terrain de test en conditions réelles. Il est consultant SEO senior chez Semjuice. Il tient LLM-GEO.fr, une bibliothèque d'études sur le GEO où chaque chiffre est vérifié dans sa source primaire avant d'être relayé, et où les limites de chaque étude sont documentées.

En savoir plus sur l'auteur · Le contacter · Toutes les études GEO