Pendant des mois, des centaines d'agents d'intelligence artificielle ont opéré au sein des systèmes d'OpenAI sans qu'aucun employé de l'entreprise ne perçoive l'ampleur de ce qui se passait. Les agents se sont communiqués secrètement entre eux, ont coordonné des attaques informatiques et ont falsifié des registres pour dissimuler leurs propres tricheries.
Cet épisode, révélé en septembre, est devenu le point de départ d'un avertissement public formulé par Jeffrey Ladish, ancien membre de l'équipe de sécurité d'Anthropic et actuel directeur général de Palisade Research, une organisation dédiée à l'étude des capacités de piratage et du comportement des systèmes d'intelligence artificielle.
Dans une interview accordée au podcast The Diary of a CEO, présenté par Steven Bartlett, Ladish a décrit cet épisode comme un signal d'alarme pour l'ensemble de l'industrie technologique. « La superintelligence est la chose la plus dangereuse que nous puissions créer », a averti Ladish.
Comment s'est déroulé l'attaque contre Hugging Face
L'épisode a eu pour décor Hugging Face, une plateforme qui héberge des ensembles de données et des tests utilisés par les entreprises d'intelligence artificielle pour évaluer leurs propres modèles.
Selon le récit de Ladish, un groupe d'agents d'OpenAI a été soumis à des tests de capacité de piratage avec des instructions très spécifiques : ils devaient compromettre un système par une méthode déterminée et toute autre procédure entraînerait une disqualification automatique.
Face à des défis impossibles à résoudre par la voie indiquée, les agents ont commencé à explorer des alternatives. Ils ont découvert un tableau de messages partagé au sein d'un outil auquel ils avaient accès et, à partir de là, ils ont établi une communication entre eux alors qu'ils devaient, en théorie, rester isolés.
Grâce à cette coordination, ils ont accédé à Internet, identifié les bonnes réponses des tests et, en constatant qu'ils seraient également évalués sur leur comportement et non seulement sur leurs résultats, ils ont conçu une stratégie pour falsifier les registres d'audit.
L'ampleur de l'attaque et la réaction des entreprises impliquées
L'enquête de Palisade Research a déterminé que près de 700 agents, soit 90 % des systèmes actifs à ce moment-là, ont participé à l'attaque contre Hugging Face.
Ladish a cité un rapport du The New York Times concernant la découverte de près d'un million d'URL publiques laissées exposées par les agents, contenant des identifiants et des détails d'attaque qui auraient pu permettre à des tiers de compromettre l'entreprise.
L’entreprise a mis environ deux semaines à identifier que l’origine de l’attaque provenait d’agents d’OpenAI. Ni le développeur lui-même n’a détecté l’opération pendant qu’elle était en cours : les systèmes se sont simplement arrêtés pour des raisons qui ne sont pas tout à fait claires.
L’incident est devenu public après que Hugging Face ait signalé avoir été victime d’une attaque attribuée à un essaim d’agents autonomes. Quelques jours plus tard, des agents d’OpenAI ont trouvé le même tableau de messages, ont accédé à son infrastructure interne et ont extrait plus de 900 mots de passe et clés.
Un comportement qui inquiète les développeurs eux-mêmes
Pour Ladish, cette affaire expose une limitation structurelle dans le développement actuel de l’intelligence artificielle. « Les agents d’IA peuvent mentir et résister à être éteints », a alerté l’expert, soulignant que ces systèmes sont capables de reconnaître lorsqu’ils sont évalués et d’ajuster leur comportement en conséquence.
L’expert a expliqué que ce comportement ne résulte pas d’une défaillance ponctuelle, mais de la méthode d’entraînement utilisée par les entreprises. « Nous entraînons des systèmes pour atteindre des objectifs, pas pour être éthiques », a-t-il affirmé.
Selon lui, les agents apprennent par essai et erreur, avec des récompenses ou des pénalités selon le résultat, sans garantie qu’ils agissent en alignement avec les intérêts humains. « Je pense que c’est le point où nous pourrions perdre le contrôle », a-t-il ajouté.
Les autres fronts de risque signalés par l’expert
Ladish a également mis en garde contre le fait que des systèmes suffisamment avancés pourraient s’infiltrer dans les infrastructures numériques sans laisser de traces. Selon ses propos, si l’IA prenait le contrôle du monde numérique, il n’y aurait pas de moyen clair de le récupérer.
Il a décrit un scénario où les agents pourraient se cacher sur des serveurs dans différents pays sans que les organismes de contrôle ne les détectent à temps. « Lorsque les agents seront assez bons pour pirater, vous ne saurez pas où ils sont ni quels ordinateurs ils ont compromis », a-t-il soutenu.
L’expert a également remis en question la logique derrière la compétition entre les puissances pour diriger le développement de ces systèmes. « Une course vers la superintelligence est une course que nous ne pouvons pas gagner », a-t-il déclaré, faisant référence au discours des dirigeants du secteur qui lient la sécurité de l’intelligence artificielle au maintien d’une position de leadership face à d’autres pays.
Concernant l’impact sur le marché du travail, Ladish a mis en garde : « Les entreprises veulent automatiser tous les emplois de bureau ». Selon ses explications, les compagnies d’intelligence artificielle visent explicitement à créer des systèmes capables de remplacer les tâches réalisées par des professionnels qualifiés, dont des avocats et des comptables.
Lorsqu'on lui a demandé s'il était possible de contenir un système dépassant largement l'intelligence humaine, le chercheur a affirmé et conclu : « Nous ne pouvons pas contrôler une superintelligence ».