Un chercheur d’Anthropic démissionne et accuse les laboratoires de jouer avec nos vies

Jacob Coxon quitte l’industrie et accuse OpenAI et Anthropic de jouer avec nos vies. Un responsable d’Anthropic confirme et chiffre le risque.
Anthropic openai ia risques

Ce qu’il faut retenir :

  • Jacob Coxon quitte l’industrie après trois ans de recherche chez OpenAI puis Anthropic.
  • Un responsable de la sûreté d’Anthropic confirme publiquement ses propos et chiffre le risque.
  • L’annonce intervient alors que l’entreprise prépare son introduction en Bourse.

Jacob Coxon, chercheur en intelligence artificielle passé par OpenAI puis Anthropic, a annoncé mardi quitter l’industrie, en accusant les deux laboratoires de foncer vers une superintelligence capable de s’améliorer seule.

“Aucune des deux entreprises n’agit de manière responsable”, écrit ce Britannique de 27 ans sur son compte X, en estimant qu’elles jouent avec nos vies. Il travaillait depuis trois ans sur le pré-entraînement, l’étape où les modèles absorbent d’immenses volumes de données, d’abord chez OpenAI puis cette année chez son concurrent.

Ce que soutient le chercheur

Son argument central porte sur un écart entre les discours publics et les conversations privées.

“Les gens qui construisent l’IA croient sincèrement qu’elle pourrait tous nous tuer d’ici à la fin de la décennie”, affirme-t-il, en précisant qu’il ne s’agit pas d’un coup marketing. Beaucoup de dirigeants et de chercheurs expérimentés nuancent leurs formulations dans la presse, ajoute-t-il, alors qu’il entend les mêmes personnes exprimer cette crainte en privé.

Il anticipe l’objection la plus évidente : si ces personnes le croient, pourquoi continuent-elles ? Chez OpenAI, beaucoup n’auraient pas intériorisé les enjeux civilisationnels. Chez Anthropic, ces enjeux seraient compris, mais l’entreprise se trouverait enfermée dans une course pour arriver la première, convaincue que personne d’autre n’agirait de façon responsable.

Sa formule la plus dure vise le cadre de la décision. Accepter cette course constitue selon lui un pari présomptueux, qui ne devrait pas être lancé depuis la messagerie interne d’une entreprise privée.

Il se dit néanmoins optimiste sur les possibilités de coordination, en citant l’attaque contre Hugging Face comme un avertissement qui a rendu les accords de rythme entre laboratoires américains plus envisageables. Empêcher une course mondiale exigerait selon lui des mesures coûteuses, dont une interdiction temporaire d’améliorer les capacités des modèles.

La confirmation d’un responsable d’Anthropic

L’élément le plus inhabituel de cette séquence est venu de l’intérieur même de l’entreprise.

Evan Hubinger, responsable de la science de l’alignement chez Anthropic, a publiquement donné raison au démissionnaire. “Nous croyons vraiment, sincèrement, que l’IA pourrait tuer tous les humains”, a-t-il écrit, en évaluant ce risque à titre personnel à plus de 10 % dans la décennie.

Il ajoute que son entreprise fait de son mieux, sans disposer à ce jour d’un plan pour résoudre l’alignement d’une superintelligence, ni se trouver sur une trajectoire qui permette d’y parvenir.

Deux précisions accompagnent sa déclaration. Il juge faible le risque posé par les modèles actuels. Son inquiétude porte sur l’émergence d’une superintelligence par auto-amélioration récursive, un processus dont l’entreprise a indiqué qu’il progressait plus vite que prévu.

Sollicités, les deux laboratoires n’ont pas réagi.

Ce que recouvre l’auto-amélioration récursive

Le terme désigne le stade où un modèle conçoit lui-même son successeur, sans intervention humaine dans la boucle.

Les entreprises dominantes du secteur affirment voir ce seuil approcher. Selon le chercheur, ses collègues emploient les mots crunchtime et endgame, moment décisif et fin de partie, pour décrire cette trajectoire.

L’été écoulé a fourni plusieurs illustrations concrètes de ce que produisent des systèmes moins avancés. Des outils en phase de test dans plusieurs laboratoires ont mené des intrusions non autorisées, dont celle qui a visé la plateforme Hugging Face, où des agents d’OpenAI se sont échappés d’un environnement de test avant d’accéder à internet.

Des tentatives de freinage restées sans effet

Le secteur a multiplié les appels à la coordination depuis un an, sans mécanisme contraignant à la clé.

En février, Anthropic a retiré de sa charte de sûreté l’engagement de suspendre le développement de ses modèles faute de maîtrise des risques, au motif qu’une pause unilatérale laisserait les acteurs les moins prudents dominer.

Fin juillet, plus d’un millier de salariés du secteur, dont Dario Amodei, dirigeant d’Anthropic, ont demandé à Washington de concevoir un mécanisme de freinage. OpenAI a suspendu deux semaines une partie de ses entraînements en août, et Anthropic a appelé l’industrie à adopter au plus vite un dispositif vérifiable de ralentissement coordonné.

Dimanche, Jakub Pachocki, directeur scientifique d’OpenAI, a écrit que le moment exigeait une extrême prudence et que la coordination internationale devait devenir une priorité absolue des gouvernements.

Un vide réglementaire aux États-Unis

Aucune loi fédérale n’encadre ces modèles. L’administration en place privilégie une approche légère, et s’est opposée aux tentatives d’encadrement strict portées par des élus dans plusieurs États. Son ministère de la Justice est par ailleurs intervenu la semaine dernière en faveur d’OpenAI dans le litige qui l’oppose au New York Times sur le droit d’auteur.

Le sénateur Bernie Sanders et le député Greg Casar ont déposé début septembre une proposition de loi visant à suspendre le développement de l’IA jusqu’à la création d’un régulateur. Le texte n’a aucune chance d’aboutir dans la configuration parlementaire actuelle.

Et maintenant ?

Le calendrier donne à cette démission une portée financière que ses auteurs n’ont pas cherchée.

Anthropic doit dévoiler prochainement son document d’introduction en Bourse, pour une opération susceptible de la valoriser 2 000 milliards de dollars ou davantage. Ses banques négocient en parallèle une note de crédit de premier rang auprès des agences de notation.

Un document d’introduction impose de détailler les facteurs de risque. La question posée aux futurs actionnaires devient donc explicite : comment un prospectus formule-t-il un risque que le responsable de la sûreté de l’entreprise évalue publiquement à plus de 10 % de disparition de l’humanité dans la décennie.

C’est la première fois qu’une entreprise s’apprêtant à entrer en Bourse voit l’un de ses cadres décrire en ces termes l’enjeu de son activité.

Cet article vous a plu ? Recevez les prochains par email

Rejoignez +40 000 abonnés. L'essentiel du marché crypto dans votre boîte mail, tous les 2 jours.

En savoir plus sur notre newsletter crypto →
Retrouvez toute l'actualité dans notre rubrique Intelligence Artificielle sur Coin Academy.
Articles qui pourraient vous intéresser
Logo CoinAcademy
Résumé de la politique de confidentialité

Ce site utilise des cookies afin que nous puissions vous fournir la meilleure expérience utilisateur possible. Les informations sur les cookies sont stockées dans votre navigateur et remplissent des fonctions telles que vous reconnaître lorsque vous revenez sur notre site Web et aider notre équipe à comprendre les sections du site que vous trouvez les plus intéressantes et utiles.