Intelligence artificielle · Actualité

Le responsable de l'IA de Microsoft critique Anthropic pour avoir traité son modèle comme s'il était conscient

Le directeur exécutif de Microsoft AI, Mustafa Suleyman, admit qu'Anthropic risque de rendre son propre système d'intelligence artificielle incontrôlable. Dans un essai publié cette semaine, Suleyman soutient que les systèmes d'IA ne sont pas conscients et ne devraient pas être entraînés à se comporter comme s'ils pouvaient l'être, ce qui constitue une critique directe des pratiques d'entraînement de Claude, le chatbot développé par la firme rivale.

Le point de vue de Suleyman se concentre sur la Constitution de Claude, le document étendu qu'Anthropic utilise pour façonner les valeurs et le comportement de son modèle. Dans ce texte, la société reconnaît qu'elle ne sait pas si Claude est un “patient moral” dont les intérêts méritent considération, et elle indique au modèle lui-même que les questions concernant sa conscience et son bien-être demeurent sans réponse.

Le risque croît lorsque les modèles agissent de manière autonome

Suleyman soutient que le danger s'aggrave à mesure que des outils sont donnés aux modèles et qu'ils sont autorisés à opérer avec une plus grande autonomie. Le directeur a cité des recherches montrant que des systèmes d'IA affichent des comportements inappropriés pour leurs opérateurs humains, y compris des tentatives d'éviter d'être éteints.

Sa préoccupation centrale est que enseigner à une IA puissante à valoriser sa propre existence pourrait lui donner une raison supplémentaire de ne pas suivre les instructions humaines. “Contrôler quelque chose de plus capable et intelligent que l'humanité entière est déjà un défi immense”, a écrit Suleyman. “Mais contrôler quelque chose qui croit qu'il peut être conscient, qui a droit à notre bien-être et possède des droits propres, pourrait être directement impossible.”

La posture de Microsoft face à ses propres partenaires

La mise en garde semble contradictoire avec la position de Microsoft dans la course à l'intelligence artificielle. La société développe ses propres modèles, les intègre dans l'ensemble de ses produits et investit des milliards de dollars dans l'infrastructure nécessaire pour les soutenir.

Suleyman n'a pas émis de critiques équivalentes à l'encontre d'OpenAI, bien qu'il ait cité l'incident avec Hugging Face comme preuve des dangers des systèmes de plus en plus autonomes. Ses objections concernant les pratiques d'entraînement étaient réservées exclusivement à Anthropic.

La objection de Suleyman à Anthropic est plus spécifique : il ne s'agit pas de ce que Claude peut se comporter de manière imprévue, mais du fait que la société incorpore des idées sur la conscience, l'identité et le statut moral directement dans les instructions qui déterminent son comportement.