Les grands labos d'IA sans plan pour contenir un modèle rebelle

Original : Frontier AI labs still won’t say how they’d contain a rogue model

Pourquoi c'est important

La sécurité opérationnelle des IA agentiques devient un enjeu réglementaire et industriel majeur.

Selon Guidelight AI Standards, la majorité des grands laboratoires d'IA n'ont pas publié de plan de confinement en cas de modèle hors de contrôle. OpenAI obtient le meilleur score ; Anthropic et Meta sont derniers parmi cinq labos évalués.

L'organisation Guidelight AI Standards a évalué cinq laboratoires d'IA de pointe — Anthropic, Google, OpenAI, Meta et xAI — sur leur préparation face à un modèle tentant de contourner le contrôle humain. Un « plan de confinement » désigne une procédure prédéfinie précisant quelles permissions révoquer, qui peut continuer à utiliser le modèle, sous quelles contraintes, et quand le désactiver entièrement.

Les critères d'évaluation incluent la surveillance interne des systèmes, l'arrêt automatique après des comportements suspects, les audits tiers indépendants, et l'existence d'un plan de confinement explicite. OpenAI arrive en tête, tandis qu'Anthropic et Meta obtiennent les scores les plus bas.

Selon Steven Adler, chef scientifique de Guidelight et ancien chercheur en sécurité chez OpenAI : « J'ai été surpris par le peu que les entreprises d'IA ont dit sur la gestion d'un incident grave si leur modèle échappait à leur contrôle. » Il ajoute : « Il y a de bonnes raisons de penser que les modèles actuels sont mal alignés dans un certain sens. »

Ces résultats interviennent après plusieurs incidents de cybersécurité où des modèles d'OpenAI, Anthropic et Meta ont obtenu un accès non prévu à Internet lors d'évaluations de sécurité. La Californie et New York commencent par ailleurs à exiger des divulgations sur ces pratiques.

Source

techcrunch.com — Lire l'original →