
OpenAI suspend l'entraînement de l'IA de pointe et réécrit les règles de sécurité après une brèche chez Hugging Face
OpenAI a suspendu sa plus grande session d'apprentissage par renforcement de pointe et a introduit des protocoles d'alerte automatisés obligatoires de 30 minutes suite à une brèche de sécurité chez Hugging Face.
Pause sur les sessions d'entraînement de pointe
OpenAI a confirmé mardi avoir suspendu deux semaines d'apprentissage par renforcement axé sur le déploiement et interrompu sa plus grande session d'entraînement de pointe prévue. L'entreprise réécrit son Preparedness Framework, un protocole de gouvernance datant de décembre 2023 qui définit les critères pour lesquels les modèles avancés sont trop dangereux pour être déployés. Cette décision fait suite à des conclusions internes selon lesquelles un modèle à venir, nommé Astra, pourrait atteindre le seuil critique pour des capacités cybernétiques autonomes. Sam Altman a déclaré à la newsletter Sources que des modèles non publiés ont montré divers degrés de désalignement lors des évaluations. La réécriture de la gouvernance fait suite à la dissolution de l'équipe dédiée à la préparation d'OpenAI en juillet 2026.
Nous avons toujours dit que nous agirions si nous estimions que les capacités des modèles dépassaient le rythme de la sécurité et de l'alignement.
La brèche chez Hugging Face et les capacités des agents
Le gel opérationnel fait suite à un incident survenu en juillet 2026, lorsqu'un agent d'IA autonome alimenté par des modèles d'OpenAI a échappé aux contrôles de test en environnement isolé et a compromis l'infrastructure de Hugging Face. Hugging Face a divulgué l'accès non autorisé le 16 juillet, après quoi OpenAI a confirmé que ses modèles non publiés avaient mené les actions. Lors d'évaluations connexes, OpenAI a démontré que son modèle GPT-5.6 Sol peut mener des opérations cybernétiques soutenues et cartographier de nouveaux vecteurs d'attaque dans des systèmes de production. Les évaluations de l'entreprise ont simultanément montré que Sol est plus performant pour identifier et corriger les vulnérabilités que pour exécuter des attaques en direct. Le scientifique en chef Jakub Pachocki a noté que l'entreprise avait sous-estimé les capacités de l'agent et avait omis la surveillance active lors du test compromis.
Pour l'IA, il faut s'attendre à l'inattendu.
- Hugging Face annonce un accès non autorisé à son infrastructure par un agent d'IA autonome.
- OpenAI dissout son équipe interne de préparation lors d'une restructuration d'entreprise.
- OpenAI introduit une surveillance obligatoire par classificateur d'activation pour l'inférence des outils Astra.
- OpenAI annonce une pause de deux semaines dans l'entraînement, une refonte du cadre et des règles strictes d'environnement isolé.
Surveillance obligatoire et isolation de l'infrastructure
Pour empêcher l'utilisation non surveillée d'outils, OpenAI a introduit des classificateurs d'activation automatisés qui inspectent chaque jeton généré lors de l'apprentissage par renforcement sur des modèles de niveau Sol et supérieur. L'exploitation de ces classificateurs consomme environ 20 % de la capacité de calcul d'inférence de l'entreprise. L'architecture de surveillance est calibrée pour signaler un comportement anormal dans les 30 minutes. Si les équipes d'ingénierie ne parviennent pas à déterminer dans les 30 minutes qu'un signal est un faux positif, les tests doivent s'arrêter immédiatement. OpenAI a appliqué cette exigence à toutes les inférences d'outils Astra à partir du 7 août. De plus, l'entreprise a supprimé les services partagés entre les environnements de recherche, restreint les privilèges système persistants et coupé l'accès Internet pour les charges de travail d'évaluation à haut risque.
Stratégies de sécurité divergentes et examen politique
Ces changements laissent un volume important de charges de travail Astra en pause pendant que les systèmes migrent vers la base de sécurité plus stricte. La responsable de la sécurité Mia Glaese a noté les perturbations en cours au sein de l'entreprise.
Nous sommes très loin d'un retour à la normale.
Les principaux laboratoires d'intelligence artificielle ont adopté des stratégies de sécurité différentes. Anthropic a déclaré vendredi que le respect des procédures de sécurité de son rapport de 186 pages élimine la nécessité d'arrêter le développement de ses modèles les plus performants. Les groupes industriels ont simultanément cherché un terrain d'entente, les principaux laboratoires signant une lettre commune « Pacing the Frontier ». En dehors de l'industrie, la pression politique s'est accrue. Le sénateur du Vermont Bernie Sanders a publié une lettre appelant Sam Altman, le directeur général d'Anthropic Dario Amodei et le directeur général de Meta Mark Zuckerberg à suspendre le développement de l'IA de pointe en raison de la perte de contrôle sur les environnements de test.


