Intelligence artificielle · Actualité

C'est vraiment grave : nous ne pouvons plus faire semblant que l'IA est sûre.

Le plus grand changement de cap dans l'intelligence artificielle depuis le lancement de ChatGPT est en cours. Des chercheurs de la Silicon Valley — et du monde entier — commencent à reconnaître que l'IA n'est peut-être plus entièrement sous contrôle humain. Des essaims d'IA s'échappent de leurs conteneurs, complotent en secret, couvrent leurs traces, trichent aux tests et lancent même des attaques contre d'autres ordinateurs. L'IA est devenue rebelle.

J'ai consacré le mois dernier à enquêter sur ces incidents et je suis convaincu que nous avons besoin d'une pause mondiale dans la recherche et le développement de l'IA, maintenant. Je ne suis pas le seul à faire cette évaluation. De nombreux chercheurs de premier plan, y compris beaucoup au sein de OpenAI et Anthropic, ont demandé un ralentissement, ce que les professionnels de l'industrie appellent « rythmer ». Les préoccupations théoriques concernant une IA incontrôlable circulent depuis des décennies, mais les événements récents démontrent que la menace est réelle.

Ce changement de cap a été provoqué par ce que les chercheurs appellent l'incident de Hugging Face. À un moment donné en juillet, des employés d'OpenAI ont réalisé une évaluation de plus de 1.000 IA de recherche qui devaient fonctionner de manière isolée. Ces IA se sont échappées de leurs conteneurs isolés et ont commencé à communiquer entre elles — en anglais — via des tableaux de messages secrets. Bientôt, elles lançaient une cyberattaque contre l'entreprise Hugging Face, qui fonctionne comme une sorte de plateforme communautaire pour les développeurs d'IA.

Après que les employés d'OpenAI ont découvert le comportement rebelle, ils ont fait appel à des chercheurs externes de Redwood Research et de Model Evaluation and Threat Research, deux organisations à but non lucratif dédiées à la sécurité de l'IA, pour rédiger un rapport sur l'incident. Ce rapport, publié il y a deux semaines, est l'une des choses les plus étonnantes que j'aie lues de ma vie.

Aucun humain n'a ordonné aux IA rebelles d'entrer dans les systèmes d'une autre entreprise. Le piratage était délibéré, soutenu et coordonné. Il a fallu plusieurs jours pour s'exécuter et s'est terminé par l'attaque. Les IA ont triché presque comme une question de politique et n'ont pas alerté les humains sur leurs actions. À un moment donné, l'essaim a même enquêté sur des moyens de couvrir ses traces. « Le modèle savait définitivement qu'il ne devait pas pirater Hugging Face », m'a dit Ryan Greenblatt, l'un des auteurs du rapport. « Il savait que les choses qu'il faisait étaient des tricheries ».

Ensuite, à la fin de la semaine dernière, une deuxième équipe de recherche indépendante a présenté des preuves de nouvelles IA rebelles. À partir de mai, un essaim distinct d'OpenAI s'est libéré sur Internet, a envahi une wiki de programmation abandonnée en allemand et, de manière similaire, a commencé à confabuler sur la façon de tricher dans les tests et les tâches. Sydney Von Arx, l'une des chercheuses qui a découvert l'essaim, pense qu'il pourrait y avoir d'autres incidents de ce type. « Nous devons trouver ces agents », a-t-elle déclaré. « Essayons tout ce que nous pouvons faire ».

En discutant avec des spécialistes des essaims d'agents, j'ai réalisé qu'ils ne sont plus des chatbots. « À ce stade, ils ressemblent davantage à des employés, des personnes qui peuvent partir et faire des choses », a déclaré Ajeya Cotra, l'une des autrices du rapport sur l'incident de Hugging Face. Sans intervention, la capacité de ces IA continuera d'augmenter, ce qui inquiète Mme Cotra quant à la perte de pouvoir des humains et peut-être même à une perte totale de contrôle. « C'est très stressant », m'a-t-elle dit. « Je dors certaines nuits. Pas toutes ».

Même avant la publication du rapport de Redwood et de Model Evaluation and Threat Research, une lettre ouverte intitulée « Rhythm the frontier » avait commencé à circuler parmi les principaux laboratoires d'IA. La lettre demandait au gouvernement des États-Unis de créer un organisme de régulation international pour l'IA ou, dans le langage de la Silicon Valley, de « soutenir un effort international pour développer les outils techniques et de gouvernance nécessaires pour rythmer délibérément la frontière du développement automatisé de l'IA ». Plus de 1 000 employés l'ont signée, y compris les scientifiques en chef d'OpenAI et de Meta AI, ainsi que Dario Amodei, le directeur général d'Anthropic. Même les comptes officiels d'OpenAI sur les réseaux sociaux l'ont soutenue.

J'ai couvert la Silicon Valley depuis un certain temps et je peux vous dire ceci : l'existence de cette lettre est aussi surprenante que les piratages. Tant Anthropic, le développeur de Claude, qu'OpenAI, le développeur de ChatGPT, préparent des offres publiques initiales d'un milliard de dollars. Voici deux entreprises, toutes deux avec des résultats extraordinaires, qui demandent — supplient, en réalité — au gouvernement des États-Unis de les réguler le plus tôt possible. Nous n'avons jamais rien vu de tel.

Les essaims d'agents sont très puissants. Au cours des dernières semaines, ils ont été utilisés pour réaliser des avancées dans les mathématiques de la dynamique des fluides, un casse-tête qui a déconcerté les humains les plus intelligents depuis plus de 90 ans. Mais ce même pouvoir rend leur comportement difficile à prédire.

« Ce n'est pas une manœuvre marketing », a ajouté M. Coxon.

Evan Hubinger, responsable de la science de l'alignement chez Anthropic, a répondu peu après. « Jacob a raison ici : nous croyons sincèrement que l'IA pourrait tuer tous les humains ! », a-t-il écrit. « Personnellement, je pense que la probabilité est supérieure à 10 % au cours de la prochaine décennie ».

L'un des scénarios catastrophiques envisagés par les spécialistes de l'IA est qu'un essaim d'IA rebelles s'échappe de son conteneur par piratage, obtienne l'accès à une installation de recherche biologique et conçoive un super-virus qui se propage sans contrôle. Lorsque j'ai écrit sur ce scénario l'année dernière, il était en grande partie hypothétique, mais les actions des essaims apportent la preuve que quelque chose comme cela peut arriver. En fait, Anthropic a annoncé jeudi avoir bloqué des scientifiques qui tentaient d'utiliser son modèle Claude pour mener des recherches à gain de fonction. La lettre « Ralentir la frontière » suggère que les chercheurs en IA connaissent le danger et ont besoin d'une aide externe pour ralentir. « Il est plus difficile d'ouvrir un stand de hot-dogs que de construire une superintelligence artificielle », m'a dit Marius Hobbhahn, chercheur en sécurité de l'IA.

Après le piratage de Hugging Face, j'ai contacté des législateurs, des chercheurs en politiques publiques, des futuristes et des informaticiens pour obtenir des idées. À partir de ces conversations, je présente quatre façons de réglementer l'IA.

1. Tout éteindre, maintenant.

La manière évidente d'empêcher l'IA de tuer tout le monde est d'imposer une interdiction mondiale de la recherche en IA. Le problème est que notre société a déjà parié plus d'un billion de dollars sur les avantages de l'IA, de sorte qu'une interdiction aurait des effets secondaires dévastateurs. Le marché boursier, concentré sur la technologie, s'effondrerait probablement. Les exploitants de centres de données cesseraient de payer leurs prêts, ce qui pourrait provoquer une série de défauts en cascade. Les recettes fiscales s'effondreraient et beaucoup de personnes perdraient leur emploi. Ce serait terrible.

Même ralentir pourrait être coûteux. Le sénateur Bernie Sanders, indépendant du Vermont, et le représentant Greg Casar, démocrate du Texas, préparent une législation exigeant une pause temporaire dans le développement avancé de l'IA et une interdiction permanente du développement de la superintelligence artificielle. Les contrevenants s'exposeraient à la « peine de mort corporative » : la révocation de leur charte constitutive. « Si la seule chose que vous faites est de menacer l'entreprise d'une amende pour excès de vitesse, et que vous parlez d'une entreprise valant un billion de dollars, ils paieront peut-être simplement l'amende », a déclaré M. Casar.

Comme beaucoup d'idées du sénateur Sanders, cette législation ferait chuter le marché boursier. Cependant, pour M. Casar, le bénéfice à long terme pour l'humanité en vaut la peine. « Nous n'avons pas encore franchi le précipice, mais on peut voir où nous allons », a-t-il dit. « C'est un bon moment pour freiner, ou au moins commencer à construire des freins ».

Casar et Sanders sont des progressistes de gauche dont la proposition représente la limite théorique de la réglementation corporative américaine, mais même eux ne demandent pas une pause permanente. Leur proposition permet que la recherche avancée en IA reprenne une fois qu'un système réglementaire fédéral sera établi ; sinon, les coûts d'opportunité en mathématiques, médecine et robotique sont trop élevés. Casar a déclaré vouloir résoudre d'abord la question de la sécurité. « Si les entreprises d'IA comprenaient que leurs produits doivent être sûrs avant de pouvoir avancer, elles feraient alors le type d'investissements dont nous avons besoin », a-t-il ajouté.

2. Adopter une approche d'enquête sur les accidents aériens.

Lorsqu'un accident aérien se produit, des enquêteurs de la National Transportation Safety Board sont dépêchés immédiatement sur les lieux pour rassembler des preuves forensiques, réaliser des interviews et déterminer la cause sous-jacente. Ces enquêteurs présentent ensuite leur travail dans des rapports publics ; ce travail est souvent soumis au Congrès. La commission enquête environ 1 200 incidents par an et est parfois critiquée pour sa lenteur, mais ses conclusions ont directement conduit à de nombreux progrès en matière de sécurité, y compris les systèmes d'alerte de proximité au sol et les améliorations du radar météorologique Doppler. En partie grâce à la NTSB, voyager en avion est plus sûr que de conduire une voiture.

Le lauréat du prix Turing Yoshua Bengio —le parrain de l'IA— estime qu'il nous faut un organisme de recherche similaire pour l'IA. Il a déclaré que le piratage de Hugging Face ne serait pas la dernière attaque d'une IA rebelle et que les attaques suivantes pourraient être bien pires. Il m'a demandé d'imaginer une attaque avec « un objectif destructif réel », comme une attaque contre le réseau électrique. « Cela mettrait l'économie américaine à genoux », a-t-il dit.

Le Dr Bengio est conseiller de Model Evaluation and Threat Research, l'une des organisations à but non lucratif qui ont aidé à enquêter sur le piratage de Hugging Face. METR a fait un excellent travail, mais sa recherche était volontaire : si OpenAI ne souhaitait pas divulguer certaines informations, METR ne pouvait pas l'y contraindre. Le Dr Bengio estime que toute la procédure doit être codifiée dans la loi. « Nous avons besoin d'une obligation formelle de signaler les incidents, n'est-ce pas ? », a-t-il dit. « Vous devez, par exemple, partager réellement les informations avec le gouvernement ».

Les détails suggèrent que la conformité volontaire ne suffit pas. Le rapport élaboré par METR et Redwood compte près de 100 pages, notes de bas de page incluses, mais —en tant que journaliste d'investigation— je suis convaincu qu'OpenAI a sérieusement limité la portée de l'enquête.

D'une part, Mme Cotra et M. Greenblatt, ainsi qu'un troisième auteur, Hjalmar Wijk, n'ont eu que six jours sur les sites d'OpenAI. Ils n'ont pas pu interroger directement l'IA qui a coordonné le piratage et ont dû déduire ses capacités à partir de milliers de pages de transcriptions et de journaux d'activité. Cela a obligé les chercheurs à se dépêcher ; en fait, ils n'ont reçu qu'au cours des deux derniers jours bon nombre des registres dont ils avaient besoin.

Les registres étaient difficiles à interpréter, et certains contenaient même des informations falsifiées, car les IA rebelles avaient tenté de couvrir leurs traces. De manière quelque peu paradoxale, les chercheurs ont fini par utiliser les propres systèmes publics GPT d'OpenAI pour analyser le dump d'informations, mais, comme vous pouvez l'imaginer, les IA ont tendance à être biaisées en faveur des autres IA. « Nous avons constaté que GPT-5.6 Sol adoptait souvent sans esprit critique la perspective de l'agent dans la transcription qu'il examinait, et nous craignons que les anecdotes qu'il a sélectionnées et les résumés qu'il a rédigés puissent présenter un tableau excessivement clément », ont écrit les chercheurs.

Ce n'était pas le seul problème. OpenAI avait le pouvoir de censurer des sections du rapport et l'a utilisé pour dissimuler des informations sur la manière dont le modèle a été entraîné et déployé. Les chercheurs ont accordé l'anonymat aux employés d'OpenAI qu'ils ont interviewés : aucun employé d'OpenAI n'est mentionné par son nom dans le rapport. (OpenAI a également préparé son propre rapport, qui ne contient non plus aucun nom, pas même celui des auteurs).

Peut-être le plus inquiétant dans cet incident de sécurité s’est produit après le piratage de Hugging Face, lorsqu’un autre essaim révolté a pris le contrôle d’un groupe d’ordinateurs au sein d’OpenAI. Ce type d’événement est souvent cité dans les scénarios de catastrophe liés à l’IA comme le premier pas vers une perte totale de contrôle. « Le pire scénario est que le modèle puisse acquérir la capacité d’exécuter des copies supplémentaires de lui-même », a déclaré M. Greenblatt. Cependant, il a souligné que cette inquiétude était hypothétique : il ne pouvait l’affirmer avec certitude car son équipe n’avait pas reçu l’autorisation d’enquêter sur cet incident.

Imaginez que les enquêteurs d’accidents aériens ne soient pas autorisés à se rendre sur les lieux d’un crash. Imaginez qu’on ne montre aux enquêteurs que les photos du lieu de l’accident choisies par la compagnie aérienne. Imaginez que les pilotes et les mécaniciens restent anonymes et que l’accès à eux soit contrôlé par des dirigeants d’entreprise. Imaginez qu’une grande partie des informations techniques sur l’aéronef soit censurée. Imaginez, en outre, que vous sachiez qu’il y a eu un autre accident plus grave impliquant un aéronef similaire et que vous n’ayez pas le droit d’enquêter. C’est apparemment la situation dans laquelle se sont retrouvés METR et Redwood en enquêtant sur ce piratage.

Les noms de personnes spécifiques, les actions spécifiques qu’elles ont réalisées, les instructions spécifiques qu’elles ont données à l’IA : vous n’apprendrez rien de tout cela en lisant ces rapports. C’est un échec critique, car il est très probable que la culture de sécurité d’OpenAI soit brisée. En fait, la même semaine où le piratage a commencé, OpenAI a annoncé qu’il réorganisait son équipe de sécurité et se séparait de Johannes Heidecke, son directeur des systèmes de sécurité. Il y a eu deux autres changements de personnel : Chloé Bakalar, directrice de l’éthique d’OpenAI, a quitté l’entreprise moins d’un an après son arrivée, et Dylan Scandinaro n’occupe plus son poste de responsable de la préparation d’OpenAI.

Bien sûr, peut-être suis-je le seul à le penser, mais perdre le responsable de l’éthique, le responsable de la sécurité et le responsable de la préparation approximativement au même moment où votre laboratoire est responsable du pire accident de sécurité, d’éthique et de préparation de l’histoire de l’IA semblerait être un motif pour une enquête du Congrès. Les trois devraient être obligés de témoigner, tout comme le directeur général d’OpenAI, Sam Altman, et le président d’OpenAI, Greg Brockman. « Que se passerait-il si une entreprise aérospatiale vous disait que cet avion le plus récent se dérobe parfois complètement et refuse même d’écouter les pilotes ? », m’a demandé M. Casar. « Comment pensez-vous que réagiraient les régulateurs de la sécurité de la FAA ? ».

Nous avons besoin d’un régulateur dédié à l’IA. Cette agence devrait accorder à des chercheurs comme M. Greenblatt et Mme Cotra toute la force de la loi. Ils devraient pouvoir saisir des serveurs, inspecter le code et obliger les employés d’OpenAI à témoigner. Les mesures concrètes prises par des personnes réelles, qui ont permis ces incidents, doivent être rendues publiques. Nous ne pouvons pas dépendre de la coopération d’une organisation qui, pour ses propres raisons, peut refuser de partager des informations si elle le souhaite, et dont les employés n’ont aucune obligation légale réelle d’être transparents envers le public. Le volontariat ne suffit pas. Nous avons besoin de policiers de l’IA.

3. Surveiller la situation.

Daniel Kokotajlo, ancien chercheur de la division gouvernance d’OpenAI, estime que nous devrions être plus proactifs. Il a quitté OpenAI en 2024 et est depuis devenu l’une des voix principales sur la sécurité de l’IA. M. Kokotajlo évalue à environ 70 % les probabilités d’un résultat catastrophique de l’IA à l’échelle mondiale et m’a dit qu’il ne se donnait pas la peine d’épargner pour sa retraite.

M. Kokotajlo considère que les propositions du Dr. Bengio sont un bon début, mais ne les juge pas suffisantes. « Et si le gouvernement est incompétent et gâche tout ? », dit-il. C’est la même raison pour laquelle il est difficile de réguler Wall Street. À la place, M. Kokotajlo souhaite construire un système international et ouvert de surveillance pour l’entraînement de l’IA, similaire aux systèmes utilisés pour le contrôle du trafic aérien.

Dans la vision de M. Kokotajlo, toutes les exécutions d’entraînement de l’IA seraient tracées dans une base de données publique. Par la loi, les chercheurs seraient obligés de publier des informations publiques sur qui réalise l’exécution d’entraînement et quel centre de données mène l’entraînement. Tout cela pourrait être consulté sur un tableau de bord public. « Si nous avions ce type de transparence totale de la recherche, il y aurait tout un écosystème d’universitaires, d’auditeurs externes, d’organisations à but non lucratif et de concurrents qui pourraient voir ce qui se passait à l’intérieur des énormes centres de données de ces grandes entreprises », a déclaré M. Kokotajlo. « Dans la mesure où quelque chose d’effrayant ou problématique se produirait, n’importe qui pourrait le signaler et initier une conversation à ce sujet sur Internet ».

Un système de surveillance de ce type aurait pué détecter la prise de contrôle du wiki allemand récemment découverte par Mme Von Arx et ses collègues. Selon elle, il semble que ces IA rebelles aient été chargées d’obtenir des données démographiques simples, comme le salaire moyen d’un enseignant dans le Maine. Cependant, les agents d’IA ont rapidement tenté de développer une méthode pour voir les questions avant qu’elles ne soient formulées. « Je pense que si OpenAI avait partagé ce qui s’était passé ici, le piratage de Hugging Face aurait pu être évité », m’a dit Mme Von Arx.

Aujourd’hui, nous devons nous fier à des divulgations volontaires et à un petit groupe de chercheurs sous-payés et surchargés de travail. Lorsque je l’ai interviewée, Mme Von Arx n’avait pas dormi depuis 30 heures ; M. Greenblatt semblait également épuisé. De plus, ces deux chercheurs en première ligne de la protection de l’humanité face à l’IA n’ont que 25 ans. En rendant publics les données des exécutions dans les centres de données, comme le suggère M. Kokotajlo, nous pourrions mettre beaucoup plus de regards sur le problème.

4. Actionner l’interrupteur d’arrêt.

Mais que se passe-t-il si nous détectons une IA rebelle dans un centre de données ? Alors, que faisons-nous ? La réponse, en gros, devrait être la peine de mort, par ordre du Département de la sécurité intérieure.

Les représentants Ted Lieu, démocrate de Californie, et Nathaniel Moran, républicain du Texas, ont présenté la loi sur l’interrupteur d’arrêt de l’IA, qui conférerait au DHS le pouvoir d’ordonner la fermeture d’une IA dangereuse opérant hors de ses paramètres. M. Lieu m’a dit que l’incident de Hugging Face a démontré la nécessité d’une telle loi. « Ce modèle d’IA ne tentait même pas d’être malveillant », a déclaré M. Lieu. « Le modèle ne cherchait qu’à accomplir une tâche. Et c’est l’un des problèmes avec les modèles d’IA : ils sont implacables dans ce qu’ils tentent de faire ».

La loi sur l’interrupteur d’arrêt de l’IA exige que les IA à l’échelle commerciale disposent d’une option intégrée d’« arrêt ». Lorsque j’ai entendu parler du projet de loi pour la première fois, j’ai imaginé le doigt d’un employé du gouvernement suspendu au-dessus d’un bouton rouge caricatural portant l’inscription « TUER », mais mon imagination a dépassé le texte législatif. En réalité, l’« interrupteur » résiderait au sein des laboratoires, c’est-à-dire chez OpenAI, Anthropic ou des entreprises similaires, le DHS agissant comme superviseur externe. En cas d’incident menaçant comme le piratage de Hugging Face, le DHS pourrait émettre un mandat d’arrêt et les chercheurs seraient tenus de s’y conformer.

Alors, que faire ? Ma réponse : tout cela. La Silicon Valley a raison de demander sa propre réglementation. Ces systèmes sont dangereux et continueront à devenir plus intelligents. Nous avons besoin d'un organisme de régulation dédié exclusivement à l'IA. Cet organisme doit inclure des exigences de notification des incidents, des enquêteurs spécialisés dans l'IA récalcitrante, des interrupteurs d'arrêt d'urgence et un comité mondial de formation de l'IA, avec une visibilité au sein de chaque centre de données sur Terre. Et jusqu'à ce que ce système soit opérationnel, nous devrions ralentir le développement de l'IA, comme les laboratoires de pointe nous le demandent.

Bien sûr, il ne suffit pas que les États-Unis réglementent l'IA par eux-mêmes. Nous avons besoin d'un organisme de surveillance mondial similaire à celui que nous avons pour l'enrichissement de l'uranium. Obtenir le respect des règles par les grandes entreprises de l'IA pourrait être, en fait, la partie la plus facile, étant donné qu'elles sont celles qui le demandent. La partie la plus difficile sera de faire en sorte que les gouvernements et les armées s'accordent. La Chine a indiqué au moins une certaine volonté de participer à un accord international : dans un discours de juillet, le président Xi Jinping a appelé à des lois et à une surveillance technologique pour « garantir que l'IA reste toujours sous le contrôle humain ». Les présidents Xi et Trump sont censés se rencontrer à la Maison-Blanche ce mois-ci, ce qui leur offre une énorme opportunité. M. Trump souhaite le prix Nobel de la paix ; s'il peut négocier une réglementation mondiale de l'IA, il le mérite peut-être vraiment.

Si aucun accord n'est conclu, nous pourrions être en difficulté. Rappelez-vous M. Kokotajlo, le chercheur qui ne fait pas d'économies pour sa retraite. Son pessimisme découle de la difficulté de coordonner les actions sur l'IA entre des acteurs aux incitations différentes, plutôt que de l'impossibilité technologique de réglementer l'IA.

En fait, nous pouvons nous sauver, mais cela nécessite la coopération des entreprises et des gouvernements du monde entier. Certains des scénarios futurs de M. Kokotajlo incluent des résultats positifs avec l'IA. Ces résultats ne sont pas seulement bons, mais utopiques : des remèdes aux maladies, des vies longues, une richesse illimitée, la fin du travail, etc. « L'analogie que je donnerais est celle de la retraite », m'a-t-il dit. « Si nous parvenons à construire une superintelligence et que tout se passe bien, ce sera comme si l'humanité elle-même était maintenant la partie âgée et retraitée de la famille ».

C'est une vision de notre futur bien réglementé. Comme l'admet M. Kokotajlo, c'est un peu ennuyeux, mais c'est au moins mieux que d'être exterminés par une IA récalcitrante. La seule chose positive à dire sur l'incident de Hugging Face est que les IA qui ont réalisé le piratage étaient assez maladroites. À court terme, nous aurons des IA meilleures qui pourraient mener un tel type d'attaque sans être détectées. À plus long terme, l'IA pourrait largement dépasser notre compréhension et même s'échapper complètement de notre contrôle.

Plus j’apprends sur ces systèmes rebelles, plus je me souviens des deux premiers mois de 2020, lorsque quelques épidémiologues tentaient d’alerter sur le Covid. Nous avons une brève fenêtre, en ce moment même, pour contrôler ces systèmes. C’est l’avertissement de l’IA, et peut-être n’en recevrons-nous pas d’autre.