Anthropic intègre un filigrane dans les textes de Claude
Original : Anthropic's 'watermark' text adulteration in Claude is a perversion of writing
Pourquoi c'est important
La conformité à l'IA Act européen impose de nouvelles contraintes techniques aux grands modèles de langage.
Anthropic a annoncé que tous les modèles Claude intégreront bientôt un filigrane dans leurs textes générés, pour se conformer à une réglementation européenne. La technique repose sur la stéganographie : le choix des mots lors de l'inférence laisse des empreintes détectables probabilistiquement, contrairement à ce que laissait entendre la documentation officielle.
Anthropic a publié une annonce indiquant que l'ensemble des modèles Claude commenceront prochainement à « filigraner » tout le contenu généré, y compris les textes, conformément à une réglementation de l'Union européenne. Le document de support original affirmait que le filigrane serait « imperceptible » et « ne changerait pas le sens, la qualité ou la lisibilité » des réponses. Pourtant, un second article publié sur un site différent, intitulé « How Claude's Text Watermark Works », révèle que la méthode repose sur la stéganographie sémantique : lors de l'inférence, le modèle oriente ses choix de tokens de façon à laisser des empreintes statistiquement détectables. John Gruber, auteur de Daring Fireball, souligne la contradiction entre les deux documents : la technique modifie bel et bien le choix des mots, ce qui contredit directement les déclarations initiales d'Anthropic. Il cite également un essai interactif de James Padolsey pour expliquer le principe général : comme le lancer d'une pièce biaisée, les biais introduits dans la sélection des tokens peuvent être détectés probabilistiquement a posteriori. Gruber conclut que cette approche adultère la sémantique des textes générés, qualifiant la démarche de « perversion de l'écriture ».