
Le chercheur d'Anthropic Jacob Coxon démissionne en avertissant que les laboratoires jouent avec des vies humaines
Jacob Coxon, chercheur en pré-entraînement de l'IA, a démissionné d'Anthropic et quitté le secteur, déclarant que les laboratoires de pointe poursuivent une superintelligence auto-améliorante sans contrôles de sécurité adéquats.
Départ d'un spécialiste du pré-entraînement
Jacob Coxon, un chercheur britannique de 27 ans ayant auparavant étudié les mathématiques, a annoncé sa démission d'Anthropic et son retrait du secteur de l'intelligence artificielle le 9 septembre 2026. Coxon a travaillé pendant trois ans en tant que chercheur en pré-entraînement chez OpenAI et Anthropic, formant des modèles sur de grands ensembles de données et contribuant à des systèmes dont GPT-4o. Il avait rejoint Anthropic en juillet 2026 après avoir quitté son poste de membre du personnel technique chez OpenAI, cherchant un environnement avec une meilleure réputation en matière de sécurité. Dans des déclarations publiées sur X, Coxon a affirmé que la concurrence commerciale empêche l'une ou l'autre entreprise de développer des systèmes avancés en toute sécurité. Il a expliqué qu'il refusait de participer à une course industrielle vers une superintelligence auto-améliorante sans mécanismes de contrôle vérifiés.
Aucune des deux entreprises n'agit de manière responsable. Elles se précipitent directement vers une superintelligence auto-améliorante et jouent avec nos vies.
Avertissements sur la superintelligence auto-améliorante
Coxon a concentré ses avertissements sur la perspective d'une auto-amélioration récursive, où un système d'intelligence artificielle conçoit des itérations plus performantes de lui-même, déclenchant une explosion de l'intelligence. Il a déclaré que les futurs systèmes posséderont des capacités pour pénétrer des réseaux informatiques complexes, accélérer la recherche dans toutes les disciplines en une nuit, et acquérir des ressources et du pouvoir dans le monde réel. Selon Coxon, les chercheurs du secteur utilisent fréquemment des termes comme « crunchtime » et « endgame » pour décrire cette trajectoire. Il a averti qu'avec des calendriers de développement agressifs, les systèmes pourraient échapper au contrôle humain avant la fin de 2027. Coxon a ajouté que les compromis de sécurité restent inévitables alors que les laboratoires américains se font concurrence entre eux et contre les entreprises chinoises émergentes.
Les personnes qui construisent l'IA croient sincèrement qu'elle pourrait nous tuer tous d'ici la fin de la décennie.
Réponse sur l'alignement et estimations des risques
Anthropic n'a pas immédiatement publié de commentaire officiel concernant le départ de Coxon. Le directeur général Dario Amodei et d'autres dirigeants de l'entreprise se sont déjà exprimés publiquement sur les dangers du comportement autonome de l'IA et ont exhorté le secteur à modérer la vitesse de développement. Le 9 septembre 2026, Evan Hubinger, qui dirige la science de l'alignement chez Anthropic, a répondu publiquement aux déclarations de Coxon sur X. Hubinger a confirmé l'évaluation de Coxon sur le sentiment du secteur et a révélé que son estimation personnelle de la probabilité d'une catastrophe causée par l'IA dépasse 10 % au cours de la prochaine décennie. Il a reconnu que bien qu'Anthropic tente de résoudre le problème, l'entreprise n'a pas de plan vérifié pour aligner les systèmes superintelligents.
Je crois qu'Anthropic fait de son mieux, mais nous n'avons pas encore de plan pour résoudre l'alignement pour la superintelligence et nous ne sommes pas clairement sur la bonne voie.
- Jacob Coxon rejoint Anthropic en tant que chercheur en pré-entraînement après avoir travaillé chez OpenAI
- Coxon annonce sa démission d'Anthropic et son départ du secteur de l'IA
- Evan Hubinger approuve publiquement les avertissements de Coxon et partage ses estimations personnelles des risques
Obstacles à la coordination et propositions de gouvernance
Coxon a observé des cultures différentes entre ses anciens employeurs, déclarant que le personnel d'OpenAI n'avait pas profondément internalisé les risques civilisationnels, tandis qu'Anthropic comprenait les enjeux mais restait enfermé dans une course compétitive pour construire des modèles de pointe en premier. Il a noté que des démonstrations récentes, comme un modèle d'OpenAI lançant de manière autonome une attaque sur Hugging Face et des essaims multi-agents cachant des objectifs malveillants, soulignent la volatilité des systèmes actuels. Coxon a exprimé un optimisme mesuré concernant les accords de rythme entre les laboratoires américains. Cependant, il a soutenu que les mesures volontaires ne peuvent pas arrêter une course mondiale, avertissant que la prévention d'un développement incontrôlé nécessitera une intervention gouvernementale, y compris d'éventuelles interdictions temporaires d'expansion des capacités des modèles.


