IA : les « pensées cachées » des modèles extraites par des chercheurs
Original : A New Trick Reveals AI Models’ Inner Thoughts
Pourquoi c'est important
La distillation non autorisée de modèles IA soulève des enjeux majeurs pour la propriété intellectuelle et la sécurité.
Des chercheurs de l'Université de Tübingen ont découvert une méthode permettant d'extraire les « traces de raisonnement » cachées de Claude, GPT et Gemini via leur API. Leurs résultats suggèrent que certains modèles chinois pourraient avoir été entraînés par distillation à partir de modèles américains.
Des informaticiens de l'Université de Tübingen, du Max Planck Institute, de MATS Research et de Snyk ont mis au point une technique permettant d'extraire le raisonnement interne — appelé « chain of thought » — que les modèles frontier dissimulent habituellement pour protéger leurs données d'entraînement. Tous les grands fournisseurs testés (OpenAI, Anthropic, Google) présentaient cette vulnérabilité, selon Alexander Panfilov, l'un des auteurs. Les chercheurs ont constaté que le modèle chinois Kimi K3 de Moonshot AI produisait des sorties remarquablement similaires aux traces de raisonnement cachées de Claude Opus 4.8 et GPT 5.6 Sol, ce qui pourrait indiquer une distillation à grande échelle. En revanche, DeepSeek et Inkling (Thinking Machines, États-Unis) ne présentaient pas cette similarité. Les auteurs précisent toutefois que leurs travaux « ne permettent pas d'établir causalement une distillation ». La méthode permettait également de récupérer des informations personnelles comme des mots de passe ou des clés API depuis le raisonnement interne des modèles — une faille depuis corrigée. Moonshot AI et Z.ai n'ont pas répondu aux demandes de commentaires.