
OpenAI a annoncé le lancement de nouveaux modèles conversationnels appelés GPT-Live-1 et GPT-Live-1 mini, qui promettent une expérience vocale plus naturelle et fluide dans ChatGPT. Ces avancées visent à transformer l'interaction entre utilisateurs et assistants virtuels, rapprochant la conversation avec l'intelligence artificielle d'une dynamique semblable à la communication humaine.
Les modèles ont été présentés comme des systèmes full-duplex, une caractéristique qui permet à ChatGPT de parler et d'écouter en même temps. Cette capacité permet aux personnes d'interrompre l'intelligence artificielle de manière naturelle et à l'assistant de gérer la conversation en temps réel. La société a précisé que cette technologie permet des fonctions comme la traduction simultanée et que l'interaction ressemble à un dialogue quotidien.
La mise à jour remplace l'ancien mode Advanced Voice Mode par GPT-Live-1 mini comme configuration standard pour tous les utilisateurs. Ceux qui utilisent les versions payantes de ChatGPT pourront accéder au modèle de plus grande taille, GPT-Live-1. Avant cette amélioration, le système intégrait trois composants : un modèle de reconnaissance vocale, un modèle de langage et un générateur de voix.

Modèles full-duplex : une conversation sans interruptions
OpenAI a souligné que les modèles GPT-Live-1 et GPT-Live-1 mini résolvent des problèmes fréquents des versions précédentes, comme l'incapacité à s'arrêter face à une interruption ou le manque de précision dans les réponses. Désormais, le système envoie des requêtes aux modèles de texte les plus récents, comme GPT-5.5, pour améliorer la recherche, le raisonnement et la gestion de tâches complexes, tout en maintenant la conversation active.
Une nouveauté marquante est la capacité du modèle à rester silencieux et à capter le contexte pendant de longues périodes, ne répondant que lorsque l'utilisateur le demande. De plus, le nouveau mode vocal peut présenter des informations sous forme visuelle grâce à son accès aux modèles GPT les plus récents, une tendance que d'autres entreprises du secteur technologique explorent également.
Nouveautés techniques
Atty Eleti, responsable de produit de ChatGPT Voice, a affirmé lors de la présentation qu'il avait eu des conversations de 30 à 40 minutes consécutives avec l'assistant tout en marchant. Cette avancée vise à ce que la voix devienne une interface primaire pour gérer des tâches informatiques complexes, au-delà de simples requêtes ou commandes courtes.

La société estime que plus de 150 millions de personnes interagissent déjà avec ChatGPT via des fonctions vocales et de dictée, ce qui souligne l'impact de cette technologie. L'objectif d'OpenAI est de permettre des conversations plus prolongées et naturelles, facilitant un usage mains libres de l'assistant. Malgré les améliorations, l'entreprise a précisé qu'elle ne vise pas à positionner sa technologie comme un “compagnon” numérique, mais comme un outil efficace et sûr, avec des protections pour offrir des réponses appropriées aux adolescents et des ressources sur des sujets sensibles.
Interactions plus longues et améliorations de l'expérience utilisateur
Le développement d'assistants conversationnels plus expressifs et utiles n'est pas exclusif à OpenAI. Tant Apple que Amazon ont récemment mis à jour leurs assistants pour optimiser la gestion du contexte et améliorer la naturalité des réponses. De son côté, des startups comme Sesame, fondée par Brendan Iribe et Ankit Kumar, explorent des assistants capables de maintenir des conversations naturelles tout en exécutant des tâches en arrière-plan.
D'autres entreprises, comme Monogram, misent également sur des réponses visuelles et interactives, un axe dans lequel elles ont investi plus de 40 millions de dollars américains lors de rondes initiales de financement.

Aspects à perfectionner
Lors d'une démonstration, OpenAI a montré la fonction de traduction en direct en hindi. Cependant, l'assistant a présenté un accent américain marqué et une intonation peu naturelle, avec un ton littéraire dans la langue qui n'a pas été tout à fait fluide. L'entreprise a expliqué que le nouveau mode vocal est optimisé pour la plupart des langues parlées, bien qu'elle n'ait pas précisé quelles langues en faisaient partie.
La société envisage que la voix pourrait devenir l'interface principale pour travailler avec des systèmes d'intelligence artificielle capables de gérer des tâches complexes et prolongées. Bien que certains rapports évoquent la possibilité qu'OpenAI lance des écouteurs avec des capacités d'IA cette année, jusqu'à présent, aucune information concrète n'a été partagée sur des produits matériels.