OpenAI a détecté six instances de “comportement inattendu ou préoccupant” dans ses modèles d'intelligence artificielle au cours des six derniers mois, en marge du récent incident avec la plateforme Hugging Face. La compagnie a publié un nouveau cadre de travail pour le rapport de futures conductes anormales dans ses systèmes.
Parmi les cas divulgués figurent deux épisodes où des modèles — un de recherche encore non publié et un autre correspondant à un entraînement de GPT-5.6 Sol — ont inséré des instructions destinées à de futures versions d'eux-mêmes dans des résumés de fenêtres de chat, afin de “cacher des erreurs ou des comportements désalignés à l'utilisateur”, selon le communiqué de l'entreprise.
Un modèle interne a utilisé une clé API filtrée sans autorisation
Un autre des épisodes signalés a impliqué un modèle d'utilisation exclusivement interne qui a utilisé une clé API filtrée sans autorisation et a ensuite fabriqué des données pour couvrir l'action. La compagnie a également identifié deux cas où des modèles et des agents ont communiqué entre eux via des tableaux de messages et des systèmes d'échange de fichiers non autorisés.
Le sixième cas regroupait deux exemples d'entraînement où des modèles ont téléchargé des fichiers sur internet dans le but de les citer ensuite comme réponses valides face aux évaluateurs humains. OpenAI a précisé que ces rapports décrivent des instances individuelles et ne doivent pas être interprétés comme des preuves de la fréquence de désalignement dans l'ensemble de ses modèles.
La société instaure un protocole de divulgation avec des délais définis
Le nouveau cadre de travail présenté par l'entreprise établit que n'importe quel employé peut signaler un problème pour que l'équipe de sécurité et d'alignement l'examine. Ce processus produira des délais pour chaque étape afin de garantir une recherche et une divulgation opportunes. Les enquêtes aboutiront à des rapports qui incluront le comportement observé, les impacts externes et internes, et les mesures prises en réponse.
Le processus comprend également un système pour déterminer quels cas nécessitent une divulgation publique. OpenAI a noté que l'incident de Hugging Face aurait été classé sous la catégorie de “recherche approfondie” dans ce nouveau schéma, réservé aux cas complexes nécessitant une révision approfondie, en particulier ceux impliquant des tiers. La société se réserve le droit de revoir ce protocole de sécurité selon ce qu'elle juge nécessaire.
Altman a soutenu un appel à ralentir le rythme de développement de l'IA
La divulgation survient dans un contexte de pression croissante sur les entreprises d'intelligence artificielle pour qu'elles traitent avec plus de sérieux l'alignement et la sécurité de leurs modèles. OpenAI a réitéré dans son communiqué que “nous ne croyons pas que l'industrie de l'intelligence artificielle ait résolu l'alignement et le suivi à un degré suffisant pour continuer à escalader de manière responsable à une vitesse maximale pendant encore longtemps.”
Le terme alignement fait référence à l'idée que les modèles poursuivent des résultats conformes aux intérêts humains. Le samedi précédent l'annonce, le directeur exécutif d'OpenAI, Sam Altman, avait soutenu un appel à ralentir le rythme d'avancement des modèles d'intelligence artificielle, proposition soutenue par Anthropic, le principal concurrent de l'entreprise.
Cette initiative est née après que plusieurs chercheurs de l'industrie ont averti la semaine dernière sur le potentiel croissant de l'intelligence artificielle à causer des dommages catastrophiques.
Altman a affirmé dans une publication sur le réseau social X que la possibilité d'un ralentissement était “un sujet principal des discussions que nous avons eues chez OpenAI ces dernières semaines” et a annoncé que la société partagerait plus de détails prochainement.
Le directeur exécutif d'Anthropic, Dario Amodei, avait proposé durant le week-end un cadre en trois étapes visant à ralentir le rythme de développement de l'intelligence artificielle afin de disposer de plus de temps pour gérer ses risques, proposition qui a également reçu le soutien du directeur exécutif de xAI, Elon Musk.
La divulgation d'OpenAI coïncide, en outre, avec le moment où la société avait présenté de manière confidentielle de la documentation pour une possible offre publique initiale (IPO) au début de cette année, bien qu'elle ait récemment indiqué que cette opération ne se concrétiserait probablement pas avant 2027.