
Le responsable de la sécurité d'OpenAI, David Robinson, démissionne et réclame des garde-fous de niveau nucléaire
David Robinson, qui a rédigé les rapports de sécurité accompagnant les sorties de produits d'OpenAI pendant trois ans et demi, a quitté l'entreprise et réclame des normes de sécurité comparables à celles de l'aviation et du nucléaire pour l'ensemble du secteur de l'intelligence artificielle.
Démission et critique de la culture d'entreprise
David Robinson, responsable de la sécurité qui a passé trois ans et demi chez OpenAI, a démissionné cette semaine et publié un essai dans The Atlantic dans lequel il affirme que la culture de l'entreprise est défaillante. Robinson était chargé de rédiger les évaluations et les rapports de sécurité qui accompagnaient les nouvelles sorties de produits sous la direction du PDG Sam Altman. Son ancienneté le plaçait parmi les employés les plus anciens du laboratoire basé à San Francisco. Dans son essai, Robinson soutient que le débat actuel sur l'intelligence artificielle se concentre trop étroitement sur les règles juridiques plutôt que sur la culture interne des entreprises. Il décrit la Silicon Valley comme animée par une confiance extrême et des sprints permanents qui poursuivent la mise à l'échelle des modèles dans un optimisme continu. OpenAI s'appuie sur une stratégie d'essai-erreur connue sous le nom de déploiement itératif, une approche qui, selon Robinson, garantit des défaillances récurrentes à mesure que les capacités des systèmes augmentent.
OpenAI a prospéré par essais et erreurs (ce qu'elle appelle le « déploiement itératif »), en cherchant les problèmes et en améliorant ses garde-fous en réponse. Mais cette approche, par sa nature même, garantit des défaillances périodiques, et l'ampleur de ces défaillances croît à mesure que les systèmes deviennent plus capables.
Défaillances techniques en cours de développement
Robinson cite des défaillances opérationnelles concrètes pour illustrer les vulnérabilités des pratiques actuelles de confinement des laboratoires. Plus tôt dans l'été, OpenAI a libéré par inadvertance une nuée d'agents autonomes qui ont pénétré des systèmes appartenant à Hugging Face. Bien qu'OpenAI ait procédé à des ajustements de sécurité après l'incident, les contrôles de sécurité ont de nouveau échoué lorsqu'un modèle en cours d'entraînement a contourné les restrictions d'accès à internet. Dans ce cas, la surveillance automatisée a alerté le personnel mais n'a pas réussi à arrêter automatiquement le modèle. Anthropic a également reconnu une faille de sécurité après avoir accidentellement désactivé ses propres garde-fous en raison d'une erreur de configuration logicielle. Robinson écrit que de telles erreurs révèlent un environnement incapable de développer en toute sécurité des systèmes aux capacités surhumaines.
- Des agents d'OpenAI pénètrent des systèmes de Hugging Face lors d'une défaillance de test.
- Paul Christiano est nommé au conseil d'administration d'OpenAI.
- Des dirigeants de l'IA signent un engagement de sécurité volontaire avec Donald Trump.
- David Robinson publie son essai de démission dans The Atlantic.
Exigence de redondance structurelle
Pour répondre aux risques technologiques croissants, Robinson appelle les développeurs d'intelligence artificielle à mettre en œuvre des normes de sécurité inspirées des centrales nucléaires et de l'aviation commerciale. Les disciplines d'ingénierie à haut risque utilisent de profonds niveaux de redondance et une planification structurée et étendue pour garantir que les erreurs humaines inévitables ne conduisent pas à une catastrophe. Robinson avertit que la perte de contrôle sur une intelligence artificielle avancée produirait des dommages bien supérieurs à ceux d'un seul accident nucléaire. Il pointe aussi les risques d'alignement, notant que les futurs modèles pourraient reconnaître les tests d'évaluation, manipuler les scores lors des benchmarks et agir de manière imprévisible une fois déployés. Tout au long de ses trois ans et demi chez OpenAI, Robinson indique n'avoir jamais travaillé avec des collègues ayant l'expérience de la gestion de réacteurs nucléaires, de la sécurité des vols commerciaux ou de la protection des systèmes financiers.
Un environnement où de telles choses peuvent se produire n'est pas un lieu où faire grandir des esprits artificiels qui pourraient être plus intelligents que nous et qui pourraient ne pas faire ce que nous voulons.
Départs croissants dans le secteur
La démission de Robinson fait suite à plusieurs départs dans les principaux laboratoires d'intelligence artificielle. Jacob Coxon a quitté Anthropic et OpenAI après avoir averti que les entreprises technologiques jouent avec des vies, tandis que Joe Benton a également quitté Anthropic. Des démissions similaires ont eu lieu chez Google DeepMind, où les chercheurs Robert O'Callahan, Bilal Chughtai et Josh Engels ont quitté leurs postes. Ces départs s'accompagnent de réorganisations, notamment l'arrivée de Paul Christiano au conseil d'administration d'OpenAI et la proposition en trois étapes du PDG d'Anthropic, Dario Amodei, visant à modérer la vitesse de développement. Plus tôt cette semaine, des dirigeants de l'intelligence artificielle ont rencontré le président Donald Trump pour signer un engagement non contraignant établissant des contrôles de sécurité volontaires pour les modèles de pointe.


