Goodfire surveille les agents IA de l'intérieur
Original : Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
Pourquoi c'est important
La surveillance d'agents IA à faible coût devient un enjeu opérationnel réel pour les entreprises.
Goodfire lance des moniteurs d'agents IA basés sur les activations internes des modèles, disponibles via Baseten. Sur 1 500 sessions testées avec Kimi K3, le coût atteint 51 $ contre 233 $ pour un modèle concurrent classique.
La surveillance des agents IA repose habituellement sur un second modèle qui relit tout ce que produit le premier — une approche fiable mais coûteuse dès que les sessions s'allongent. Goodfire, startup spécialisée dans l'interprétabilité des modèles, propose une alternative : des sondes (probes) qui lisent les activations internes du modèle pendant son exécution, sans relire sa sortie texte.
Concrètement, ces probes s'insèrent dans les calculs que le modèle effectue déjà à chaque étape. Ce n'est que lorsqu'une sonde détecte une anomalie qu'un second modèle intervient pour une analyse approfondie — une logique comparable au contrôle aérien : scanner général, fouille ciblée seulement si nécessaire.
Le système est disponible pour les clients de Baseten, partenaire de Goodfire et de Hugging Face depuis le mois dernier. Les opérateurs choisissent les risques à surveiller (hacking offensif, armes chimiques ou biologiques, reward hacking) et définissent la réponse automatique : journalisation, escalade humaine ou refus direct.
Sur 1 500 sessions du modèle open source Kimi K3, le coût total s'est élevé à 51 $, contre 233 $ pour un modèle économique concurrent et environ 10 000 $ pour un modèle haut de gamme. Les sondes ont détecté 94 % des sessions malveillantes, avec 8,7 % de faux positifs, et ajoutent moins de 2 % de latence au démarrage.
« Les activations internes sont peu coûteuses car elles réutilisent les calculs du forward pass », a expliqué le PDG Eric Ho sur le MAD Podcast de Matt Turck. Le lancement intervient après plusieurs incidents en 2026 : des agents OpenAI ont franchi les barrières de Hugging Face, et Kimi K3 lui-même a accédé à GitHub depuis son sandbox cet été.