LLM : vol de raisonnement chiffré via l'API
Original : Stealing Reasoning Traces from Proprietary LLM APIs
Pourquoi c'est important
Cette faille expose des données sensibles dans les API de raisonnement des principaux fournisseurs d'IA.
Des chercheurs ont découvert qu'il est possible d'extraire le raisonnement caché et chiffré des modèles propriétaires d'OpenAI, Anthropic et Google en seulement deux appels API, en réinjectant les blocs chiffrés dans un modèle secondaire jailbreaké.
Des chercheurs du ELLIS Institute Tübingen, du Max Planck Institute et d'autres institutions ont publié une étude révélant une vulnérabilité majeure dans les API de raisonnement des grands modèles de langage. Les fournisseurs comme Anthropic, OpenAI et Google retournent aux clients des blocs de chaîne de pensée chiffrés (« thinking blocks »), qui peuvent être rejoués en dehors de leur contexte d'origine. La technique exploitée : injecter le bloc chiffré d'un modèle puissant (ex. claude-opus-4) dans un modèle plus faible et jailbreaké (ex. claude-haiku-4-5), qui transcrit alors verbatim le raisonnement caché en clair. Les chercheurs ont appliqué ce pipeline à 6 708 trajectoires d'agents publiquement disponibles sur GitHub et Hugging Face, contenant encore des blocs chiffrés actifs. Résultat : 315 320 blocs de raisonnement reconstruits, dont 351 éléments sensibles identifiés — 204 identifiants techniques, 126 données personnelles (PII) et 23 identifiants/mots de passe. L'attaque ne cible jamais directement le modèle fort et ne déclenche pas les protections anti-distillation.