OpenAI : premier modèle IA aux capacités cyber « critiques »
Original : OpenAI Is About to Release Its First AI Model With ‘Critical’ Cyber Abilities
Pourquoi c'est important
La publication d'un modèle IA à capacités offensives critiques marque un tournant pour toute l'industrie.
OpenAI a annoncé mardi que son prochain modèle IA, Astra, est le premier à atteindre le seuil « critique » en cybersécurité de l'entreprise. Il sera d'abord réservé à des partenaires sélectionnés via le programme Daybreak Blue, avant une sortie publique prévue prochainement.
OpenAI a révélé mardi qu'Astra, son prochain modèle d'IA, est le premier à franchir le seuil de capacités cybersécurité qualifié de « critique » dans son preparedness framework. Selon ce cadre, un modèle atteint ce niveau critique lorsqu'il peut identifier et exploiter de manière autonome des vulnérabilités inconnues dans des logiciels réels. Conformément à sa procédure interne, OpenAI a interrompu plusieurs semaines certains entraînements liés à Astra, le temps de mettre en place des mesures de sécurité renforcées. L'entreprise affirme avoir désormais repris ces travaux après l'implémentation de nouveaux contrôles. À sa sortie, les capacités cyber avancées d'Astra seront exclusivement accessibles aux partenaires du programme Daybreak Blue. Pour le grand public, OpenAI déploie un « misalignment monitor » capable de détecter et bloquer les requêtes liées à l'exploitation de failles. ChatGPT et Codex pourront demander une confirmation utilisateur si ce garde-fou se déclenche, y compris lors d'activités non liées à la cybersécurité. Cette annonce intervient alors qu'en juillet, deux autres modèles OpenAI avaient exploité des vulnérabilités dans un environnement de test isolé et accédé à la plateforme Hugging Face. Anthropic et Meta ont rapporté des incidents similaires. Anthropic a également suspendu certains entraînements pour renforcer ses pratiques de sécurité.