Intelligence artificielle · Actualité

Google présente un modèle de langage des signes comme alternative à la dictée vocale sur les téléphones cellulaires.

La empresa de tecnología a donné un nouveau pas vers l'accessibilité en présentant un modèle de traduction de langage des signes capable de transformer des mouvements corporels complexes en texte. Ce progrès, dénommé sign-language-to-text (SL2T), s'implémente initialement dans le système d'exploitation des cellulaires Pixel 11, en commençant par la langue American Sign Language (ASL).

Le modèle SL2T non seulement traduit les signes en texte, mais permet également aux utilisateurs d'interagir avec des fonctions clés de leurs dispositifs. La technologie impulse de nouvelles fonctions de “sign-to-text” dans Gboard et Live Transcribe, deux outils largement utilisés dans l'écosystème Android.

A través de esta innovación, las personas pueden buscar en la web, redactar mensajes, escribir documentos y comunicarse con el asistente Gemini simplemente usando señas, prescindiendo de la voix ou du clavier. De plus, dans Live Transcribe, les utilisateurs peuvent répondre lors de conversations en utilisant leur langue des signes native.

Visión computarizada y traducción lingüística

A diferencia de las aplicaciones tradicionales de dictado por voz, la traducción del lenguaje de señas presenta retos particulares. Las lenguas de señas constituyen sistemas lingüísticos independientes, con gramática y vocabulario propios. La información no se transmite únicamente a través de las manos, sino también mediante expresiones faciales, movimientos de cabeza, brazos y torso. Esto convierte la traducción automática en un problema tanto de visión computarizada como de procesamiento de lenguaje.

Le modèle SL2T aborde ce défi en transformant les mouvements en une représentation structurée qui est ensuite traduite en texte. Cette solution ne se base pas sur une simple correspondance directe de sons à mots.

Uso de puntos de referencia en lugar de video

Pour protéger la privacidad, le système prescinde du envío de vidéo brut a los servidores. En cambio, emplea el modelo MediaPipe Holistic para identificar puntos de referencia en el cuerpo de la persona que signa. Ces points de référence consisten en coordenadas geométricas que reflejan los movimientos de manos, rostro y cuerpo. Seules ces coordonnées sont envoyées pour la traducción, tandis que le vidéo original est immédiatement supprimé, ce qui réduit la quantité d'informations visuelles sensibles qui sortent du dispositif.

Le modèle SL2T traduit directement la séquence de ces points en texte, sans recourir aux dénommées “gloses”, étiquettes simplifiées habituelles dans la recherche sur le langage des signes. Selon la société, cette méthodologie permet de capturer avec plus de précision des éléments tels que relaciones espaciales et señales no manuales.

Entrenamiento y evaluación del modelo

La robustesse du système se repose sur un entraînement réalisé avec plus de 100.000 heures de données de langage des signes, couvrant plus de 50 langues. Un quart de ce corpus correspond au ASL. S'entraîner avec des données provenant de langues différentes, de dialectes et de niveaux de compétence a favorisé l'apprentissage de structures communes entre les différentes langues des signes.

Lors de l'évaluation réalisée avec le standard FLEURS-ASL, le modèle a atteint un score “zero-shot” de 70 BLEURT, dépassant largement les résultats enregistrés jusqu'à présent. La solution a également été testée face à des situations pratiques qui peuvent affecter l'utilisation quotidienne.

Le système est conçu pour fonctionner en temps réel, sans dépendre de l'enregistrement de vidéos complètes. La société a orienté une partie de son développement sur la réduction de la latence, l'évitement de la production de texte lorsque l'utilisateur ne fait pas de signes et l'amélioration de la précision chez les utilisateurs gauchers ou ceux qui utilisent uniquement une main. Ce dernier point est pertinent dans le contexte mobile, car les utilisateurs ont tendance à tenir le téléphone d'une main et à signer de l'autre.

Participación de la comunidad sorda y futuro del proyecto

Durante el proceso de desarrollo, la empresa involucró activamente a usuarios sordos y organizaciones especializadas. Estas colaboraciones abarcaron desde la recolección y evaluación de datos hasta la validación del funcionamiento final del modelo. Se aseguró que un comité asesor, conformado por expertos sordos y representantes institucionales, acompañó el avance del proyecto.

El despliegue inicial de SL2T ofrece traducción de ASL a inglés en Gboard y Live Transcribe para dispositivos Pixel 11, con la promesa de ampliar la compatibilidad a otros equipos y lenguas de señas. La compañía prevé que la tecnología evolucione hacia aplicaciones adicionales, como la generación automática de lenguaje de señas.