Intelligence artificielle · Actualité

Des chercheurs ont développé une intelligence artificielle capable de reconstruire les images visuelles à partir d'un scanner cérébral. Cette technologie utilise des données neuronales pour interpréter ce qu'une personne regarde, ouvrant ainsi la voie à de nouvelles applications en neurosciences et en interfaces cerveau-ordinateur.

Une équipe de scientifiques de l'Institut Weizmann des sciences, à Rehovot, en Israël, a développé un outil d'intelligence artificielle capable de deviner ce qu'une personne observe à partir de ses scanners cérébraux et de recréer cette image avec un niveau de précision inédit. Le système fonctionne également dans l'autre sens : il peut prédire à quoi ressemblerait l'activité cérébrale d'un individu à partir d'une image qu'il n'a pas encore vue.

La chercheuse Michal Irani, qui a dirigé le développement avec ses collègues, espère que cet outil servira à approfondir les connaissances sur le fonctionnement du cerveau. Parmi les applications envisagées figurent la possibilité d'aider à communiquer des personnes atteintes du syndrome d'enfermement ou celle de permettre aux scientifiques de recréer le contenu des rêves.

Décodeur à deux branches pour améliorer la fidélité des images

Les neuroscientifiques utilisent depuis des années l'imagerie par résonance magnétique fonctionnelle (IRMf) pour tenter de reconstruire ce que les gens voient ou pensent. Les premières tentatives ont donné des images floues et difficiles à interpréter. La technique mesure le flux sanguin oxygéné dans le cerveau : chaque « voxel » d'activité dans un scanner conventionnel couvre environ trois millimètres cubes et contient environ 16 000 neurones, une résolution qui limite la spécificité des résultats.

L'équipe d'Irani est partie de jeux de données publics collectés avec des scanners à plus haute résolution, où chaque voxel couvre environ un millimètre cube de neurones. Ces informations correspondaient à huit personnes à qui environ 9 000 images avaient été montrées pendant qu'elles se trouvaient dans un équipement IRMf haute résolution.

Le « décodeur cérébral » résultant est composé de deux branches : l'une prédit la structure de l'image, c'est-à-dire où se situent les couleurs, et l'autre prédit son contenu. Les deux prédictions alimentent un modèle de diffusion, le même type d'IA utilisé pour générer des vidéos et des images, qui affine progressivement une masse de pixels bruités jusqu'à produire une représentation fidèle de ce que la personne a observé.

Un encodeur supplémentaire a multiplié les données d'entraînement

Pour perfectionner le système, les chercheurs avaient besoin de plus de données que celles disponibles. La solution a consisté à entraîner un deuxième modèle, un encodeur capable de prédire à quoi ressemblerait l'activité cérébrale d'une personne face à une image donnée.

L'encodeur et le décodeur ont ensuite été entraînés conjointement : à partir d'une nouvelle image, l'encodeur estime le scanner cérébral correspondant et le décodeur tente de reconstruire l'image originale à partir de cette estimation.

Ce processus, répété des milliers de fois, a permis des améliorations substantielles. Environ 70 % des données d'entraînement provenaient d'images qui n'avaient jamais été montrées à une personne dans un scanner IRMf.

Le croisement des données de multiples études a également permis d'identifier des régions cérébrales ayant des fonctions partagées entre différents individus : l'une semblait répondre à des images de nourriture et l'autre à des images de sport. Irani, spécialiste en informatique, travaille désormais avec des neuroscientifiques pour explorer si ces outils peuvent révéler de nouvelles découvertes sur le cerveau.

Le système ne nécessite qu'une heure de données par personne

L'un des progrès les plus soulignés par les chercheurs est la réduction du temps de calibration. Alors que d'autres outils similaires nécessitaient environ 40 heures de données IRMf d'un nouveau sujet avant de pouvoir prédire ce que cette personne observe, le « codeur cérébral universel » développé par l'équipe d'Irani ne nécessite qu'une heure.

Pour Tommy Sprague, neuroscientifique à l'Université de Californie à Santa Barbara, qui n'a pas participé à l'étude, cette donnée est pertinente pour la recherche en cours : « Aucun d'entre nous ne peut se permettre 40 heures de tests d'imagerie pour un nouveau sujet », a-t-il affirmé. Selon Sprague, chaque heure de ce type de tests coûte entre 600 et 1 000 dollars, de sorte que des outils comme celui-ci pourraient accélérer les études sur le cerveau.

Les résultats ont été présentés le mois dernier au congrès Cognitive Computational Neuroscience, à New York, et ont surpassé dans des tests comparatifs d'autres outils décrits précédemment. Le système lui-même présente encore des défauts : Irani a montré des exemples où un gâteau a été reconstruit comme une pile de trois sandwichs, et un chien dans une baignoire s'est transformé en chèvre d'une couleur similaire.