Transparence IA
Le filigrane invisible de Claude arrive. Une réécriture complète l'efface
Anthropic ajoute un filigrane invisible aux futurs modèles Claude pour respecter les règles de l'AI Act européen sur le marquage des contenus générés par l'IA. Il est gratuit et intraçable, mais il ignore le code exact, les passages courts et les textes entièrement réécrits.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-21 · 5 min de lecture

Les futurs modèles Claude seront dotés d'un filigrane de texte intégré. Anthropic le présente comme un moyen d'estimer la probabilité que Claude ait participé à la rédaction d'un passage donné, et la raison officielle de ce changement est l'AI Act européen, qui, à partir du 2 août, exige des fournisseurs d'IA desservant le marché européen qu'ils marquent les contenus générés par l'IA. Anthropic a signé le code de conduite européen sur la transparence des contenus générés par l'IA en juillet 2026, parmi environ 190 signataires, et applique le filigrane à l'échelle mondiale car elle ne dispose pas encore d'un moyen durable de le limiter par région.
Ce qui est plus intéressant que le mécanisme, c'est ce qu'Anthropic concède dans le même article. Le filigrane est conçu pour pouvoir être lu a posteriori par toute personne détenant la clé. Il n'est pas conçu pour survivre à quelqu'un déterminé à le supprimer. Une légère révision ne s'en débarrassera probablement pas complètement, mais une réécriture complète, où chaque mot est remplacé, le fera. L'exigence de marquage de l'UE est satisfaite avec un outil qui suppose une certaine coopération.
Comment fonctionne le filigrane : remplacer le hasard, pas les mots
Les modèles de langage choisissent le texte un mot à la fois dans une liste de candidats. Lorsque plusieurs options sont également plausibles, le choix est tranché par un nombre aléatoire. Après « The weather today was cold and... », le mot suivant ne sera pas « sugary », mais il pourrait plausiblement être « overcast » ou « grey ». Le filigrane modifie la source de ce hasard. Au lieu d'un générateur de nombres aléatoires arbitraire, Claude utilise la clé et quelques mots précédents pour trancher. Les mots restent aléatoires et restent dans l'ensemble que Claude aurait de toute façon envisagé ; la méthode ne pousse jamais le modèle vers quelque chose comme « nubilous », un synonyme obscur que presque personne n'attendrait.
Le résultat est invisible pour les lecteurs. Toute personne disposant de la clé peut comparer la séquence de mots à ce que la clé produirait et attribuer une probabilité que Claude ait généré le texte. L'implémentation d'Anthropic est une version de SynthID-Text, l'approche que Google DeepMind a publiée dans un article de Nature en 2024, appartenant à une famille qui remonte à une proposition de Scott Aaronson en 2022. Dans l'article sur SynthID-Text, DeepMind a testé la technique sur une partie du trafic de Gemini et n'a constaté aucune différence statistiquement significative dans les évaluations positives et négatives par rapport à un modèle sans filigrane.
L'analogie d'Anthropic : les joueurs d'un jeu de société obtiennent leurs lancers de dés à partir d'un livre de chiffres de pi plutôt que de dés. Le jeu se déroule de la même manière pour tous les participants, mais un spectateur qui connaît la séquence peut ensuite déterminer que pi en était la source. Le texte de Claude fonctionne de la même manière. L'expérience est identique ; la provenance est vérifiable.
Là où le filigrane échoue : le code exact et les textes légèrement modifiés
Anthropic est explicite sur les angles morts. La détection devient plus fiable à mesure qu'un passage s'allonge, mais les petits échantillons contiennent trop peu de choix de mots pour établir une certitude. Le texte factuel ne laisse rien au filigrane sur quoi agir : après « Isaac Newton's most famous work was called Principia », le mot suivant doit être « Mathematica », sans autre alternative aussi bonne. Le code est en grande partie similaire. La sortie exacte ne laisse aucune place à un ajustement : le code comporte donc généralement moins de filigrane que la prose ordinaire ; les endroits arbitraires, comme les commentaires, peuvent encore être marqués.
La relecture est une autre lacune. Lorsque Claude corrige le texte d'un humain, presque tous les mots restent ceux de l'auteur, et la poignée de corrections peut être trop faible pour être détectée. Plus Claude écrit, plus il prend de décisions, et plus le filigrane a d'espace. Les traductions sont entièrement filigranées car Claude choisit chaque mot.
Le filigrane répond également à une question étroite. Il peut estimer la probabilité que Claude ait été impliqué à un moment donné, mais il ne peut pas distinguer « Claude a écrit ceci » de « Claude a fortement édité ceci », et il ne dit rien sur la propriété ou les droits d'auteur.
Ni coût, ni traçage, et une API de détection en préparation
Ce changement est conçu pour être peu coûteux et discret. Le filigrane ne produit aucun jeton supplémentaire et a un impact négligeable sur la vitesse, de sorte que servir et utiliser Claude coûte le même prix. Il ne contient aucune information d'identification : rien dans le filigrane ou la clé ne permettrait à quiconque de retrouver des détails sur un utilisateur, son organisation ou ses conversations.
La vérification nécessite la clé, c'est pourquoi Anthropic affirme qu'elle proposera bientôt une API de détection du filigrane, dont les détails de mise en œuvre sont encore en cours d'élaboration. Cela distingue également le filigrane des logiciels de détection d'IA tels que Pangram, qui n'ont pas de clé et fonctionnent en recherchant des indices de formulation, ces habitudes subtiles qui apparaissent dans les sorties des modèles. La détection reste une course aux armements avec la génération, et le générateur peut jouer en second, une dynamique que nous avons documentée dans la fabrique de contenu IA.
Les fichiers empruntent une autre voie. Lorsque Claude produit un format pris en charge tel qu'un PNG, un JPG ou un SVG, il attache un justificatif de contenu, une petite note signée cryptographiquement dans les métadonnées, utilisant la norme C2PA, la même que celle employée par les fabricants d'appareils photo. Contrairement au filigrane textuel, rien n'est intégré dans le fichier. Tout outil compatible C2PA peut lire la note, qui indique uniquement que Claude a été impliqué. Les anciens modèles Claude, couverts par la période de transition de la législation européenne pour les modèles lancés avant le 2 août 2026, recevront le filigrane dans les mois à venir.
| Méthode | Ce qu'elle marque | Comment elle est vérifiée | Limite principale |
|---|---|---|---|
| Filigrane textuel (SynthID-Text) | Les mots choisis par Claude | Vérification du motif avec clé sur la séquence | Supprimé par une réécriture complète |
| Justificatif de contenu C2PA | Les fichiers produits par Claude (PNG, JPG, SVG) | Signature cryptographique lue par tout outil compatible C2PA | Vit dans les métadonnées, pas dans les pixels |
| Logiciel de détection d'IA (Pangram, etc.) | Tout texte, sans clé | Correspondance de motifs sur les indices de formulation | Ne peut pas vérifier le filigrane lui-même |
Dire si cela satisfait l'intention derrière l'exigence européenne est une autre question. Le filigrane est un instrument de conformité avec des limites publiques. Il fonctionne sur des textes longs et fluides que personne ne retouche ensuite. Il se tait sur le code, sur les légères modifications de textes humains et sur tout passage que l'on prend la peine de réécrire, ce qui est précisément le terrain où le contenu synthétique a tendance à se propager.
- Source : Claude's invisible watermark is coming. A full rewrite erases it — 2026-08-13
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.