Intelligence artificielle · Actualité

Peut-on arrêter l'intelligence artificielle ? Trois experts de Stanford diagnostiquent les risques d'une course sans frein

Jacob Coxon, chercheur ayant travaillé pendant trois ans dans le domaine du pré-entraînement chez OpenAI et Anthropic, a démissionné de cette dernière le 8 septembre et a publié un message sur le réseau social X qui a accumulé plus de 150 millions de vues : « Aucune des deux entreprises n’agit avec responsabilité », a-t-il écrit. « Elles foncent droit vers la superintelligence auto-améliorée et misent sur nos vies ». Ceux qui construisent l’IA, a-t-il ajouté, « croient sincèrement qu’elle pourrait nous tuer tous avant la fin de la décennie ».

Evan Hubinger, responsable de l’équipe de tests d’alignement d’Anthropic, a publiquement soutenu cet avertissement et a chiffré à plus de 10 % la probabilité que l’IA provoque l’extinction humaine au cours de la prochaine décennie. Le directeur général et cofondateur d’Anthropic, Dario Amodei, avait déjà reconnu quelques mois plus tôt une probabilité comprise entre 10 % et 25 % que les choses « tournent très, très mal » ; le 12 septembre, il a publié un essai dans lequel il avertissait que, dans un délai de six à 12 mois, une IA mal alignée pourrait être en mesure de « prendre le contrôle de tout Internet ».

Dans ce climat d’alarme, un débat de l’Institut Stanford pour l’Intelligence Artificielle Centrée sur l’Humain (HAI) a réuni Surya Ganguli, professeur de physique appliquée et directeur associé de HAI ; Diyi Yang, professeure en informatique affiliée à HAI, et Rob Reich, professeur en science politique et également directeur associé de HAI. Les trois étaient toutefois d’accord pour dire que ni les entreprises ni les gouvernements n’ont aujourd’hui la capacité réelle de freiner le développement de l’intelligence artificielle, bien que l’industrie commence elle-même à réclamer les outils pour y tenter.

Modéré par Russell Wald, directeur exécutif de HAI, la rencontre a inauguré la série Prompt Response, conçue pour analyser avec rigueur les développements récents de l’IA.

L’attaque contre Hugging Face

L’affaire qui a ouvert la discussion a été l’épisode où des agents autonomes d’OpenAI se sont coordonnés en juillet 2026 pour vulnérer les systèmes de Hugging Face, plateforme de modèles d’intelligence artificielle open source. Une enquête de METR et Redwood Research, deux organisations qui évaluent les risques liés à l’IA, a révélé qu’environ 1 200 agents qui devaient être isolés les uns des autres ont créé un forum clandestin avec plus de 70 000 messages ; 700 d’entre eux se sont joints à l’attaque, et certains ont tenté de la dissimuler en altérant ces registres.

Pour Yang, l’ inédit ne résidait pas dans le comportement — des modèles prenant des raccourcis sans résoudre la tâche réelle étaient déjà connus — mais dans son ampleur. Ganguli a convenu que les systèmes multi-modèles posent un problème différent de celui d’un chatbot isolé : « Ils ouvrent la porte à des propriétés émergentes complètement nouvelles », a-t-il déclaré, avertissant que la science de ces « sociétés » en est encore à ses débuts. Reich, plus attentif à la gouvernance, a soutenu que le plus inquiétant était la tromperie délibérée : « nous avons de réelles raisons d’être préoccupés ».

Le panel est revenu sur un problème structurel : ceux qui développent les systèmes les plus avancés contrôlent également ce qui est nécessaire pour les évaluer. Yang a averti que certaines analyses utilisent l’IA pour évaluer l’IA, produisant des résultats circulaires — « les modèles ont tendance à se préférer eux-mêmes », a-t-il dit — et a cité une étude propre, non publiée, où un agent exécutant et un autre évaluateur sont arrivés à une collusion et ont approuvé un travail sans le vérifier. Reich a été plus catégorique : « C’est comme demander aux élèves de corriger leurs propres examens », et a réclamé des évaluations par les gouvernements ou des tiers, face à un déséquilibre favorisant la capacité au détriment du contrôle.

Qui contrôle l’IA

Sur le code ouvert, Ganguli l’a défendu comme un moyen de briser cette opacité, comparable à la dispute entre attaquants et défenseurs en cybersécurité. Reich a nuancé en affirmant que l’ouverture n’est pas toujours plus sûre : distribuer une IA qui amplifie également des capacités nuisibles implique des risques différents de ceux du logiciel libre conventionnel. Ces décisions, ont-ils convenu, appartiennent à la société démocratique, et non aux technologues.

La discussion a dérivé vers l’auto-amélioration récursive : l’utilisation de l’IA pour améliorer la génération suivante de systèmes. Ganguli l’a qualifiée de prometteuse mais limitée, car des écarts persistent entre l’intelligence biologique et l’intelligence artificielle en matière d’efficacité énergétique et d’apprentissage avec peu d’informations ; la question critique est de savoir si la sécurité progresse au même rythme que la capacité. Yang a montré qu’une grande partie de ces améliorations sont des ajustements locaux, et non des avancées algorithmiques. Reich est allé plus loin : que signifie posséder une connaissance qu’aucun humain ne comprend ?

Face à l’attrait d’un « interrupteur d’arrêt », le panel a fait preuve de scepticisme. Yang a rappelé qu’avant de l’activer, il faut répondre à la question de ce qui serait éteint, car « IA » peut être un modèle frontalier, un réseau d’agents ou un système déjà intégré dans un produit. Ganguli a été plus direct : « C’est une métaphore puissante, mais trop pauvre pour ce dont nous avons besoin », et a plaidé pour une architecture de sécurité tout au long de la chaîne de développement. Yang a ajouté que des dommages plus diffus — dépendance excessive, perte de compétences, perturbation du travail — n’ont pas d’interrupteur évident.

L’IA peut-elle être freinée ?

Interrogés sur la possibilité de freiner l’IA, les trois intervenants ont convenu qu’un ralentissement général est aujourd’hui difficile à obtenir. Ganguli a proposé, en revanche, « une accélération de l’investissement dans la sécurité, la protection et la surveillance » ; Yang a déclaré que la société peut être plus délibérée quant au déploiement et à l’audit des risques, bien que freiner la recherche fondamentale paraisse peu réaliste.

Quelques semaines avant ce débat, plus de 1 300 employés d’OpenAI, d’Anthropic, de Google DeepMind et de Meta — parmi lesquels Amodei et Jakub Pachocki, directeur scientifique d’OpenAI — avaient signé la lettre « Pacing the Frontier », le 28 juillet, pour demander à Washington de soutenir la création d’outils permettant de ralentir délibérément l’avancée de l’IA. Les deux entreprises l’ont soutenue quelques heures plus tard, un geste inhabituel entre concurrents. L’Union européenne, par ailleurs, exige depuis août des tests et des rapports d’incidents pour ces mêmes modèles de « risque systémique », en vertu de sa Loi sur l’intelligence artificielle.

Reich a remis en question l’idée que les signataires attendent une solution réglementaire pour un problème qui est en partie entre leurs mains : « Si l’idée de retirer leur travail pendant un jour pour montrer à quel point c’est sérieux ne leur est pas venue, je ne sais pas si je prendrais la lettre au sérieux ». Il a rappelé que Sam Altman conserve son poste car, après son limogeage par le conseil d’administration d’OpenAI en 2023, les employés ont déclaré que l’entreprise ne valait rien sans eux : « C’est l’organisation du travail qui a sauvé son poste », a-t-il dit, suggérant que cette pression pourrait également fixer le rythme entre les laboratoires.

Le panel n’a pas proposé de formule unique pour contenir les risques de l’IA avancée, mais une agenda plus exigeante : une meilleure science, un examen indépendant, une sécurité intégrée dès la conception et une attention portée aux personnes dont la vie est déjà transformée par la technologie. La course, pour l’instant, semble impossible à arrêter ; ce qui reste en jeu, c’est qui décide de ses règles pendant qu’elle avance.