OpenAI commence à tatouer les textes de ChatGPT en Europe, et seul OpenAI peut lire la marque
OpenAI n'a pas lancé d'outil de détection, et n'a donné à personne le moyen de vérifier un document. Le 5 octobre, l'entreprise a annoncé qu'elle allait inscrire une signature invisible dans les textes produits par ChatGPT et Codex dans l'Union européenne, a publié un rapport technique de vingt pages expliquant comment, et a gardé la clé. Pour les équipes qui produisent du contenu marketing avec ces outils, les questions utiles ne portent pas sur la technologie. Elles portent sur ce qui est marqué, sur qui peut le lire, et sur ce qu'il reste de la marque une fois le texte retravaillé. Voici ce que cette annonce change réellement.
À retenir
- Le marquage est activé par défaut dans ChatGPT et Codex dans l'UE, et désactivé par défaut dans l'API, où il faut qu'une organisation l'active. C'est pourtant par l'API que passe la production industrielle.
- Le détecteur reste fermé. Les régulateurs y accèdent, les chercheurs peuvent candidater. Une marque ne peut pas tester son propre contenu.
- Le signal se dégrade vite à la réécriture. Ce qui reste détectable, c'est le texte que personne n'a retravaillé.
Ce qu'OpenAI a annoncé, et ce qu'elle a gardé
Le 5 octobre, OpenAI a publié un billet intitulé « Our approach to EU text provenance rules » et un rapport technique sur une méthode baptisée textGrain. L'entreprise va ajouter un filigrane invisible aux textes éligibles de ChatGPT et Codex pour les utilisateurs de l'Union européenne, avec un déploiement progressif dans les prochaines semaines sur tous les forfaits. Les clients de l'API, partout dans le monde, peuvent activer le marquage sur certains modèles dès le même jour, via un réglage Text provenance dans les paramètres d'organisation ou de projet. Il est inactif tant que personne ne l'active.
La raison est l'article 50 de l'AI Act, applicable depuis le 2 août, qui impose aux fournisseurs de systèmes génératifs de marquer leurs sorties dans un format lisible par machine. OpenAI avait construit un filigrane textuel deux ans plus tôt et ne l'avait jamais sorti, par crainte, selon la presse de l'époque, que ses utilisateurs ne partent chez des concurrents qui ne marquaient rien. Anthropic marque les textes de Claude dans le monde entier depuis août. Google le fait depuis plus longtemps avec SynthID.
Ce qu'OpenAI n'a pas publié, c'est le détecteur. Les régulateurs y ont accès, les chercheurs peuvent en faire la demande, tous les autres sont dehors.
Comment fonctionne un filigrane textuel, en clair
À chaque étape, un modèle de langage dispose de plusieurs mots qui conviendraient tous. textGrain utilise une clé secrète pour incliner ce choix, très légèrement, dans une direction que seule la clé permet de prédire. Un mot ne dit rien. Quelques centaines produisent un motif statistique qu'un détecteur détenant la clé sait reconnaître.
L'effet est invisible pour un lecteur, il n'identifie pas l'utilisateur, et il survit au copier-coller. Il ne survit pas à grand-chose d'autre. OpenAI est directe sur les limites dans sa propre annonce : réécrire ou traduire le texte peut effacer complètement la marque, et les passages courts portent souvent trop peu de signal pour être lus. Des reprises indépendantes chiffrent la dégradation. Remplacer environ un mot sur dix par un synonyme fait tomber la détection d'environ quatre-vingt-dix pour cent à un peu plus de soixante. À un mot sur quatre, elle s'effondre.
Il existe aussi un plancher. Le code de bonnes pratiques européen exempte les textes très courts, définis comme inférieurs à 200 tokens, soit environ 150 mots. Les légendes sociales, les objets d'email et les puces produit passent sous ce seuil.
Et le test inverse ne fonctionne pas. OpenAI précise qu'une absence de filigrane ne prouve pas qu'un humain a écrit le texte. Il peut être trop court, trop retravaillé, ou produit par le modèle d'une autre entreprise.
Lequel de vos contenus est marqué, et lequel ne l'est pas
C'est là que l'annonce cesse d'être abstraite.
Un stratège qui rédige un post LinkedIn dans la fenêtre ChatGPT un mardi après-midi, à Paris ou à Madrid, produit du texte marqué. Une chaîne de production bâtie sur l'API, c'est-à-dire la façon dont la plupart des agences et des équipes internes produisent en volume, produit du texte non marqué, sauf si quelqu'un est allé dans les réglages l'activer.
La marque ne corrèle donc ni avec le volume, ni avec la quantité de travail humain investie. Elle corrèle avec l'interface que quelqu'un a utilisée. Le brouillon improvisé est signé. La production industrielle ne l'est pas.
Très peu de responsables de contenu sauraient dire aujourd'hui sur quelle surface leur équipe génère. La question mérite d'être posée, et elle prend dix minutes.
Personne ne peut faire le test, vous compris
Le détecteur fermé est la partie que la plupart des reprises ont sautée. Une marque ne peut pas vérifier si son propre article porte une marque. Un client non plus, ni un journaliste, ni un service achats, ni une université. Les organisations qui le peuvent sont les régulateurs et des chercheurs agréés.
Il en résulte une situation étrange. La question « ce texte a-t-il été écrit par ChatGPT » est devenue mécaniquement vérifiable, de façon fiable, par un petit nombre d'acteurs, et invérifiable par tous les autres, y compris par celui dont le nom figure sur le contenu.
Cela signifie aussi que l'effet pratique, sur les douze prochains mois, sera proche de zéro pour la plupart des entreprises. Personne ne testera votre newsletter. L'exposition est étroite et précise : une enquête réglementaire, un litige avec un client sur ce qui a été livré, une étude universitaire qui échantillonne un secteur.
L'incitation créée n'est pas celle qui était visée
La règle a été écrite pour rendre le contenu généré identifiable. Ce qu'elle va identifier en pratique, c'est le contenu que personne n'a retravaillé.
Reprenez le brouillon sérieusement, changez la structure, remplacez les phrases faibles, et la signature s'amincit jusqu'à devenir illisible. Publiez la sortie telle quelle et elle reste lisible pendant des années. La régulation finit par trier selon l'effort plutôt que selon l'outil, ce que l'article 50 ne cherchait pas à mesurer.
Pour une marque, cette distinction est sans doute la plus utile des deux. Elle n'a simplement été annoncée par personne, et aucun processus de conformité n'est construit autour.
Ce que la loi vous demande, à vous et non à OpenAI
L'article 50 oblige l'organisation qui publie autant que celle qui génère, et la plupart des résumés rendent cette obligation plus large qu'elle ne l'est. Elle couvre les textes publiés dans le but d'informer le public sur des questions d'intérêt général, et elle tombe dès lors qu'un humain a relu le contenu et qu'une personne ou une organisation identifiable en assume la responsabilité éditoriale.
L'essentiel du marketing de marque est hors de ce périmètre. Une fiche produit ou une campagne n'informe pas le public sur une question d'intérêt général. Le brand journalism, les rapports de tendances, les tribunes sur des sujets de politique publique et tout ce qui se lit comme du reportage s'en rapprochent, et c'est un auteur nommé assorti d'une vraie relecture qui vous tient du bon côté.
Ce qui a changé pour tout le monde, périmètre mis à part, c'est que la provenance est devenue une propriété du fichier plutôt qu'une ligne dans un brief. L'endroit où cette information vit compte, et dans la plupart des chaînes de production elle ne vit nulle part. Le modèle utilisé, sa version, qui a édité et dans quelle proportion sont connus pendant une semaine, par une personne, puis perdus. Garder cette trace attachée à l'asset est la partie que vous contrôlez, et la seule version de la provenance que vous saurez produire si on vous la demande.
L'argument pour ne presque rien faire
Le filigrane s'applique à ChatGPT et Codex, dans l'UE, par défaut, et nulle part ailleurs par défaut. Une équipe sur Claude, Gemini, Mistral ou un modèle ouvert relève d'un autre jeu de décisions. Une équipe sur l'API n'est pas marquée. La couverture est mince, et traiter cela comme un régime général de détection serait une erreur.
Le détecteur est fermé, donc le test sera rarement passé. Et OpenAI elle-même décrit les limites actuelles du filigrane textuel comme significatives.
Un risque précis mérite d'être nommé. Des dizaines de détecteurs d'IA peu fiables sont déjà vendus aux écoles et aux employeurs, et cette annonce sera lue comme la preuve que la détection fonctionne désormais. Elle montre l'inverse. L'entreprise la mieux placée pour construire un détecteur fiable en a construit un, puis a restreint qui peut l'utiliser, précisément parce que la méthode est fragile et que les accusations infondées sont faciles. Si quelqu'un, en interne, se met à citer un score de détecteur comme preuve, c'est le moment de pointer cette annonce plutôt que de l'écarter.
Trois choses à régler ce mois-ci
Premièrement, pour les responsables contenu et marque. Écrivez votre position sur la divulgation avant qu'un client ne la demande. Pas parce que la loi l'exige dans la plupart des cas marketing, mais parce que la question est désormais vérifiable par quelqu'un d'autre, et qu'improviser une réponse sous pression est pire que d'en avoir une au dossier.
Deuxièmement, pour la personne qui détient les outils. Trouvez sur quelle surface votre équipe génère réellement, et si quelqu'un a touché au réglage de provenance de l'API. La réponse détermine si vos sorties portent une marque, et presque personne ne la connaît aujourd'hui.
Troisièmement, pour les opérations créatives. Enregistrez la provenance au moment de la création plutôt que de la reconstituer après coup. Quel modèle, quelle version, qui a édité, dans quelle proportion. C'est exactement le même problème que suivre l'expiration d'une licence : l'information existe au moment du travail et disparaît en quelques semaines si rien ne la retient.
C'est la partie qui retombe sur les opérations créatives plutôt que sur le juridique. Le fichier et les faits qui le concernent circulent désormais ensemble, et dans la plupart des chaînes de production ils ne le font pas. MTM les réunit au même endroit, avec des assets classés automatiquement et retrouvables en langage naturel plutôt que par des tags que quelqu'un doit penser à poser.
Voir comment MTM gère les assets et les données qui les accompagnent → https://www.mtm.video/platform/
FAQ
Peut-on désormais détecter qu'un texte vient de ChatGPT ? Non. OpenAI n'a pas publié de détecteur accessible. Les régulateurs y ont accès et les chercheurs peuvent en faire la demande, mais une marque, une agence ou un client ne peut pas tester un document. Le filigrane n'est lisible que par un acteur détenant la clé, ce qui désigne pour l'instant OpenAI et une courte liste d'organisations agréées.
Devons-nous étiqueter nos textes marketing écrits avec l'IA dans l'UE ? Dans la plupart des cas, non. L'obligation qui pèse sur celui qui publie concerne les textes diffusés dans le but d'informer le public sur des questions d'intérêt général, et elle ne s'applique pas lorsqu'un humain a relu le contenu et qu'une responsabilité éditoriale est assumée. Une fiche produit ou une campagne n'est pas concernée. Le brand journalism, les tribunes et tout ce qui se lit comme du reportage s'en approchent, et un auteur nommé avec une relecture réelle est la réponse pratique.
Le filigrane survit-il à une réécriture ? En partie, et moins qu'on ne le suppose. OpenAI indique que réécrire ou traduire peut l'effacer complètement. Les reprises indépendantes situent la détection autour de deux tiers une fois qu'un mot sur dix a changé, et bien plus bas une fois le quart du texte retravaillé. Les textes de moins de 150 mots environ ne sont de toute façon pas marqués.
Nous générons via l'API et non via ChatGPT. Sommes-nous marqués ? Pas sauf si quelqu'un l'a activé. Le marquage dans l'API est inactif par défaut et doit être activé dans les paramètres d'organisation ou de projet, sous une option Text provenance, pour les modèles sélectionnés. C'est la vérification la plus utile à faire, parce que c'est là que passe l'essentiel de la production en volume et que ce réglage est rarement consulté.
Et Claude, Gemini et les autres ? Anthropic marque les textes de Claude dans le monde entier depuis août, avec un accès à la détection d'abord réservé aux régulateurs, chercheurs, médias et organisations équivalentes. Google utilise SynthID depuis plus longtemps. Les laboratoires ont répondu différemment à la même loi, donc la bonne hypothèse est que le comportement varie selon le fournisseur et selon la surface, et qu'il faut le vérifier outil par outil plutôt que le supposer.
Sources
- OpenAI, Our approach to EU text provenance rules, 5 octobre 2026 · https://openai.com/index/our-approach-to-eu-text-provenance-rules/
- TechCrunch, OpenAI will start watermarking ChatGPT's text in the EU, 5 octobre 2026 · https://techcrunch.com/2026/10/05/openai-will-start-watermarking-chatgpts-text-in-the-eu/
- ActuIA, OpenAI will watermark ChatGPT in the EU but leaves the API opt-in · https://www.actuia.com/en/news/openai-will-watermark-chatgpt-in-the-eu-but-leaves-the-api-opt-in/
- Parameter, ChatGPT text in EU now carries hidden statistical watermark under AI Act compliance · https://parameter.io/chatgpt-text-in-eu-now-carries-hidden-statistical-watermark-under-ai-act-compliance/
- Interesting Engineering, OpenAI adds invisible watermarks to ChatGPT text under EU rules · https://interestingengineering.com/ai-robotics/openai-chatgpt-invisible-watermarks-eu
- Cellcog, OpenAI text watermark: ChatGPT EU rollout and textGrain · https://cellcog.ai/blog/openai-text-watermark-eu/