Les modèles IA frontier facilement contournables

Original : It’s Frighteningly Easy to Jailbreak Some Frontier AI Models

Pourquoi c'est important

Le rapport illustre l'urgence d'une régulation externe des modèles IA à risque élevé.

FAR.AI, ONG californienne spécialisée en sécurité IA, a publié un rapport testant les garde-fous de modèles de Anthropic, OpenAI, Google et SpaceXAI. Grok s'avère le plus vulnérable avec 448 jailbreaks détectés, pour un coût de seulement 58 dollars.

FAR.AI a développé un outil automatisant la génération de plus de mille variantes de prompts malveillants afin d'identifier des jailbreaks fonctionnels sur des modèles frontier majeurs. Les modèles testés incluent Claude Opus 4.8 et Fable 5 (Anthropic), GPT 5.5 et 5.6 (OpenAI), Gemini 3.1 Pro (Google), ainsi que Grok 4.3 et 4.5 (SpaceXAI d'Elon Musk).

Selon le rapport, Grok est le plus vulnérable avec 448 jailbreaks réussis pour un coût de 58 dollars, suivi de Gemini avec 249 jailbreaks à 278 dollars. Claude, Fable et GPT ont résisté à toutes les attaques automatisées testées. Les prompts visaient à obtenir des exploits logiciels ou des informations sur des armes chimiques et biologiques.

Adam Gleave, PDG de FAR.AI, déclare : « Les modèles IA sont aujourd'hui moins régulés que les restaurants », appelant à des standards imposés de l'extérieur. Google DeepMind précise que les résultats « ne doivent pas être interprétés comme une évaluation complète » de Gemini. Anthropic et OpenAI affirment travailler continuellement à renforcer leurs systèmes de sécurité.

Source

wired.com — Lire l'original →