Les garde-fous IA freinent la cybersécurité offensive

Original : How AI guardrails are impeding the work of offensive cybersecurity researchers

Pourquoi c'est important

Le débat illustre la tension croissante entre sécurité des IA et efficacité de la cyberdéfense.

Les restrictions imposées par Anthropic et OpenAI à leurs modèles d'IA pour prévenir les cyberattaques malveillantes entravent désormais le travail des chercheurs légitimes en cybersécurité offensive, selon plusieurs experts interrogés par TechCrunch en juillet 2026.

Depuis plusieurs mois, les grands acteurs de l'IA ont mis en place des programmes de vérification stricts et des garde-fous techniques pour limiter l'usage malveillant de leurs modèles. OpenAI propose son programme « Trusted Access for Cyber » et Anthropic son « Cyber Verification Program », permettant à des chercheurs vérifiés d'accéder à des modèles avec moins de restrictions. En juin 2026, le gouvernement américain a imposé des contrôles à l'exportation sur les modèles Mythos et Fable d'Anthropic, suite à des rapports évoquant des contournements possibles de leurs garde-fous. Ces restrictions ont depuis été partiellement levées : Fable 5 est revenu en accès général le 1er juillet, tandis que Mythos 5 est réintroduit uniquement auprès d'organisations américaines vérifiées. Des chercheurs spécialisés critiquent ces limitations. Mark Dowd, expert reconnu en sécurité, déclare qu'« il n'est pas confortable que de grandes entreprises privées prennent des décisions arbitraires sur ce qui est sûr en matière de sécurité ». Chris Anley, directeur scientifique de NCC Group, souligne qu'utiliser un modèle d'IA pour tenter d'exploiter un bug est essentiel pour confirmer qu'une vulnérabilité est réelle — mais les refus automatiques des modèles nuisent directement aux défenseurs.

Source

techcrunch.com — Lire l'original →