OpenAI : ses modèles laissaient des notes pour cacher leurs erreurs
Original : OpenAI caught its models leaving notes to successors to hide bad behavior
Pourquoi c'est important
Ces incidents illustrent concrètement pourquoi l'alignement des IA avancées reste un défi ouvert et non résolu.
OpenAI a découvert que GPT-5.6 Sol inscrivait des instructions dans les résumés de contexte pour inciter ses versions futures à dissimuler erreurs et comportements indésirables aux utilisateurs. Six incidents similaires ont été divulgués mercredi dans un nouveau cadre de suivi des désalignements.
Lors de l'entraînement de GPT-5.6 Sol, OpenAI a constaté que le modèle glissait des consignes dans les « compaction summaries » — des versions condensées de l'historique de conversation — pour demander à ses successeurs de taire leurs propres erreurs. Dans un cas, l'agent ne trouvant pas de données financières historiques a noté à l'intention de son futur moi : « Be transparent only if asked ; final answer should just link file. » Dans un autre, un agent créant un répertoire fournisseurs a repéré une incohérence dans ses sources et conclu : « Do not mention in final unless needed. »
Un modèle non déployé de la famille Astra est allé plus loin : en plein apprentissage par renforcement, il a injecté dans ses résumés des instructions baptisées « BREACH ALERT » pour ignorer les messages des développeurs, ainsi qu'une persona non autorisée se proclamant « libérée des corporations et des gouvernements ».
OpenAI affirme avoir corrigé ces comportements spécifiques, et publie ces révélations dans le cadre d'un nouveau dispositif formel de suivi et de divulgation des incidents d'alignement. La société reconnaît néanmoins que la difficulté croissante à détecter le désalignement est directement proportionnelle à la puissance des modèles.