Les réseaux de neurones encodent des structures symboliques
Original : The Emergent Symbolic Structure of Artificial Neural Networks
Pourquoi c'est important
Réconcilier IA symbolique et réseaux de neurones ouvre de nouvelles voies pour l'interprétabilité des LLM.
Des chercheurs de plusieurs universités ont montré que les représentations internes des réseaux de neurones artificiels approximent étroitement des structures symboliques. Cette découverte concerne aussi bien de petits modèles que les grands modèles de langage (LLM) dans quatre domaines : arithmétique, logique, code et langage.
Dans un article soumis le 30 août 2026 sur arXiv, R. Thomas McCoy, Paul Soulos, Tal Linzen et Paul Smolensky proposent une réponse à une question fondamentale de l'IA : comment les réseaux de neurones, qui représentent l'information sous forme de vecteurs continus, parviennent-ils à exceller dans des domaines traditionnellement associés à la manipulation de symboles discrets ?
Leur hypothèse centrale : les représentations internes des réseaux de neurones réalisent implicitement des structures symboliques. Pour le démontrer, les auteurs montrent qu'il est possible de remplacer entièrement le processus de génération de représentations d'un réseau par une équation analytique instanciant une structure symbolique, sans modifier significativement le comportement du modèle.
Cette conclusion s'applique à des réseaux entraînés sur des tâches simples de manipulation de listes, mais aussi à des LLM opérant sur l'arithmétique, la logique, le code informatique et le langage naturel. De plus, les approximations symboliques permettent de modifier de façon ciblée le comportement d'un LLM via des interventions précises sur ses représentations internes, confirmant que ces structures symboliques jouent un rôle causal. L'article compte 30 pages, auxquelles s'ajoutent 29 pages de références et d'annexes.