Intelligence artificielle · Actualité

Google a lancé un avatar avec IA qui converse en temps réel face à face avec les clients.

Google a présenté Gemini 3.8 Live with Live Avatar, une fonctionnalité qui ajoute un visage animé et synchronisé avec la voix à son intelligence artificielle conversationnelle pour un usage corporatif. L'entreprise a effectué l'annonce et activé immédiatement le service pour les entreprises utilisant Google Cloud.

L'outil combine le dialogue en direct de Gemini avec la génération de vidéo à faible latence. Le résultat est un avatar qui écoute, regarde et répond avec une synchronisation des lèvres, des expressions faciales et des tours de conversation fluides.

Conçu pour les entreprises, pas pour l'utilisateur final

Live Avatar s'adresse aux sociétés souhaitant offrir une assistance client ou des parcours interactifs via un personnage virtuel. Google le présente comme un moyen d'élargir les canaux de contact numérique avec une interaction plus proche d'une conversation avec une personne.

La fonctionnalité est déjà disponible dans Gemini Enterprise, la plateforme d'agents d'intelligence artificielle de Google Cloud. L'entreprise a renvoyé vers sa documentation technique pour permettre aux développeurs de commencer à l'intégrer dans leurs produits.

L'annonce intervient seulement neuf jours après le lancement de Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, les modèles de dialogue en direct sur lesquels repose cette nouvelle capacité visuelle de l'entreprise.

Ce lancement, du 15 septembre, avait amélioré le raisonnement et l'exécution de tâches par la voix, mais sans encore la composante visuelle que Live Avatar ajoute désormais.

Selon les données citées par Google à l'époque, Gemini 3.8 Live Extended Thinking a dominé l'indice de qualité de la voix à la voix de la société Artificial Analysis, avec un score de 82,6 points, et a résolu 97,7 % des tests de raisonnement audio de Big Bench Audio.

Dans cette annonce précédente, l'entreprise avait déjà mentionné Salesforce, Genspark et Lumeris parmi les entreprises ayant testé les modèles de dialogue en direct, soulignant leur faible latence et leur capacité à exécuter des outils pendant la conversation.

Google a également indiqué que des plateformes de développement telles qu'Agora, LiveKit, Pipecat et Vercel ont déjà intégré l'interface de programmation de dialogue en direct, permettant à d'autres équipes de construire des interfaces vocales sans gérer l'infrastructure de diffusion en temps réel.

Tâches en arrière-plan sans interrompre la conversation

L'un des attributs mis en avant par Google est l'exécution asynchrone des outils. L'avatar peut activer des fonctions et rechercher des données en arrière-plan tout en poursuivant la conversation, sans interrompre l'échange avec la personne en face.

À titre d'exemple, l'entreprise a présenté un cas d'usage dans lequel l'avatar gère l'enregistrement d'un client dans un hôtel : il consulte la réservation et exécute les formalités internes tout en continuant à parler normalement.

Cette fonction vise également l'échelle mondiale. Live Avatar synchronise le mouvement des lèvres et les expressions avec la parole dans 97 langues et peut basculer entre elles au milieu d'une même conversation sans perdre la qualité vidéo.

Cette transition, selon Google, se produit sans dégrader la fidélité visuelle ni générer d'artefacts perceptibles sur le visage de l'avatar.

Contrairement aux modèles de base, qui sont également accessibles au grand public depuis le 15 septembre via Search Live et l'application Gemini, Live Avatar reste pour l'instant limité à l'environnement d'entreprise de Google Cloud.

Avatars de marque et filigranes

Google a montré dans la même annonce des exemples de différents personnages avec des voix et des styles visuels propres, pour illustrer la gamme d'identités qu'un même avatar peut adopter selon la marque qui le déploie.

Les organisations peuvent choisir entre une bibliothèque d'avatars prédéfinis ou en générer un à partir d'une image de référence, en conservant la ressemblance et le style visuel de cette marque.

Pour l'instant, la création d'avatars personnalisés n'est activée que pour les clients d'entreprise autorisés par Google via un système de liste d'accès restreint.

Tout le contenu produit par Live Avatar, qu'il soit audio ou vidéo, est marqué avec SynthID, la technologie de filigrane développée par Google DeepMind. Selon l'entreprise, ce sceau est tissé de manière imperceptible dans l'audio et la vidéo, et permet d'identifier a posteriori que le matériel a été généré par l'intelligence artificielle.

Google a présenté cette protection comme faisant partie d'un objectif déclaré de transparence, visant à réduire la désinformation et l'attribution erronée du contenu généré par ses propres modèles.

L'entreprise a également publié une fiche technique du modèle audio sous-jacent, avec le détail de ses capacités et des mesures de sécurité appliquées avant ce lancement.

L'entreprise a renvoyé vers la documentation de l'interface de programmation de Gemini Enterprise et vers sa console d'administration pour les développeurs qui souhaitent commencer à construire avec la nouvelle fonction à partir d'aujourd'hui.