Intelligence artificielle · Actualité

Grok Voice Transcribe 2.0 est désormais disponible : la nouvelle IA d'Elon Musk qui convertit l'audio en texte

xAI a lancé Grok Voice Transcribe 2.0, son nouveau modèle de reconnaissance vocale, avec une amélioration de précision que la compagnie évalue au double par rapport à la génération précédente. Le système est conçu pour convertir des conversations et des enregistrements audio en texte et peut déjà être utilisé via l'API de reconnaissance vocale de la compagnie.

Le modèle maintient le prix de son prédécesseur : 0,10 dollar par heure d'audio pour les transcriptions par lots et 0,20 dollar par heure pour le traitement en temps réel.

xAI a également annoncé que la nouvelle version deviendra prochainement le modèle par défaut de son API, tandis que Grok Voice Transcribe 1.0 sera retiré dans les prochaines semaines.

Un modèle entraîné pour des environnements réels

Grok Voice Transcribe 2.0 est basé sur le modèle audio qu'xAI utilise pour Grok Voice. La compagnie affirme que cette technologie traite déjà des dizaines de milliers d'appels au service client chaque jour, transcrit des millions d'heures de narrations vidéo et permet d'exécuter des agents vocaux dans des produits physiques, y compris l'assistant Grok intégré dans les véhicules Tesla.

Pour développer la nouvelle version, xAI a utilisé des enregistrements audio en direct, avec du bruit de fond et dans différentes langues et environnements. Par la suite, elle a appliqué des processus de post-entraînement pour améliorer le comportement du modèle dans des situations d'utilisation habituelles.

Selon la compagnie, Grok Voice Transcribe 2.0 occupe la première place en précision parmi 32 modèles de diffusion analysés dans le classement public d'Artificial Analysis. Dans ses propres tests, xAI a également comparé le système à des modèles tels que Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 et Whisper Large v3.

Les tests internes ont utilisé quatre types d'audio : appels au service client, conversations avec Grok, informations parlées telles que des codes et des adresses e-mail, et commandes vocales courtes dans différentes langues.

L'amélioration la plus importante concerne les langues

xAI souligne que le plus grand progrès par rapport à Grok Voice Transcribe 1.0 réside dans la transcription multilingue. Le modèle peut travailler avec des dizaines de langues, détecter automatiquement celle qui est utilisée et suivre une conversation où l'interlocuteur change de langue.

Cette capacité est particulièrement pertinente pour les commandes courtes, où il y a peu de contexte pour identifier la langue. Lors des tests de xAI avec des phrases brèves d'assistants vocaux dans 19 langues, le taux d'erreur de mots est passé de 20,6 % dans la version précédente à 6,8 % avec Grok Voice Transcribe 2.0.

Fonctionnalités pour les développeurs

L'API permet d'utiliser le modèle pour des fichiers audio préenregistrés ainsi que pour des transcriptions en temps réel. Parmi ses fonctions figurent les balises de temps et les scores de confiance au niveau du mot, l'identification de différents locuteurs et la transcription de jusqu'à huit canaux audio.

Il intègre également un système pour prioriser des termes spécifiques à un secteur, avec jusqu'à 100 mots ou expressions par demande. Le modèle peut renvoyer correctement écrits les nombres, dates, devises, téléphones et adresses e-mail, en plus de supprimer les mots remplisseurs.

Pour les agents vocaux, xAI inclut une fonction de détection de tour qui permet de déterminer quand une personne a fini de parler et que le système peut répondre.

L'API prend en charge 12 formats audio, des fichiers jusqu'à 500 Mo et différentes fréquences d'échantillonnage. Elle offre également des paramètres pour travailler avec 25 langues.

Loom utilise déjà le nouveau modèle

Une des premières implémentations mises en avant se trouve sur Loom, la plateforme d'enregistrement d'écran d'Atlassian. Selon xAI, Atlassian a comparé Grok Voice Transcribe 2.0 à sa solution précédente et a déterminé que le nouveau modèle offrait une plus grande précision.

Dès cette évaluation, Loom a commencé à utiliser Grok Voice Transcribe 2.0 pour transcrire ses vidéos. Atlassian souligne également la possibilité de combiner ces transcriptions avec des outils de programmation comme Cursor pour convertir les instructions parlées en code.

Le modèle est déjà sélectionnable via les interfaces REST et WebSocket de xAI. Pendant la transition, ceux qui doivent continuer à utiliser la version précédente pourront spécifier manuellement grok-voice-transcribe-1. Cependant, xAI prévoit de faire de Grok Voice Transcribe 2.0 l'option par défaut et de retirer progressivement la première version.