Intelligence artificielle · Actualité

L'IA a besoin de seulement 10 secondes d'audio pour cloner la voix de n'importe quel humain.

ElevenLabs a présenté ses nouveaux modèles vocaux v4 et v4 Turbo, dont la caractéristique centrale redéfinirait la norme du secteur : l'intelligence artificielle n'a besoin que de 10 secondes d'audio pour cloner la voix de n'importe quel humain.

Cette capacité s'ajoute à un meilleur contrôle expressif, une latence réduite et un support pour plus de 90 langues. L'entreprise cherche à étendre sa présence dans des secteurs tels que les services aux entreprises, la production de contenu et l'assistance client.

Clonage de voix avec seulement 10 secondes d'audio : comment ça fonctionne

La nouvelle architecture d'ElevenLabs permet de générer de l'audio avec seulement 10 secondes d'échantillon vocal, selon l'entreprise. Cela représente une réduction drastique par rapport aux exigences habituelles de clonage de voix dans le secteur.

Le système ne se contente pas de reproduire le timbre avec un échantillon bref, mais il préserve mieux l'identité vocale même dans les textes longs, un problème récurrent dans les générations précédentes où la voix tendait à perdre de sa cohérence au fil de l'audio.

Ce progrès dans le clonage de voix basé sur l'IA a des applications directes dans le doublage, l'accessibilité et la production de contenu, car il réduit le temps et les ressources nécessaires pour créer une réplique vocale fonctionnelle.

Le clonage de voix par intelligence artificielle permet de reproduire le timbre et les particularités d'une personne à partir d'une enregistrement minimal. Avec les modèles d'ElevenLabs, 10 secondes d'audio suffisent pour que le système génère de nouvelles phrases avec cette même identité vocale, même dans des passages étendus.

Contrôle expressif et voix qui dirigent l'interprétation

La version précédente de l'entreprise intégrait déjà des étiquettes pour contrôler les expressions dans l'audio généré. Avec v4, l'entreprise étend ces instructions et permet de les combiner en séquence au sein d'une même pièce.

Cela permet, par exemple, à un créateur de demander une lecture qui commence avec un ton calme, évolue vers un registre enthousiaste et se termine par une pause plus contenue. Dans les audiobooks, la formation d'entreprise ou la publicité, ce type de nuances distingue une narration fonctionnelle d'une qui sonne artificielle.

Le développement marque un changement d'approche dans la voix synthétique : les systèmes cessent de se limiter à imiter les timbres et commencent à diriger l'interprétation, le rythme et le contexte. Ce saut est pertinent car il rapproche la technologie des flux de travail professionnels où il ne suffit pas de lire un texte, mais où il faut transmettre une intention spécifique.

Agents conversationnels avec une latence réduite

ElevenLabs vise également le développement d'agents conversationnels via v4 Turbo. Selon TechCrunch, le modèle peut commencer à générer de l'audio dès que le modèle de langage produit une réponse, ce qui réduit les temps morts pendant une conversation.

L’entreprise souligne également que le système gère de manière différenciée les escalades, les attentes et les situations de conflit, des éléments qui s’avèrent critiques dans les contextes de support téléphonique ou de vente, où le rythme et le ton de la réponse influencent l’expérience de l’utilisateur.

Extension des langues pour un contenu global

Le support linguistique d’ElevenLabs passe de 70 à plus de 90 langues, avec des améliorations spécifiques pour le japonais, le portugais brésilien, le mandarin et le cantonais. Pour les entreprises opérant à l’échelle multinationale, cette extension réduit le besoin de recourir à des solutions distinctes pour chaque marché.

Pour les créateurs individuels, cette avancée ouvre la possibilité de générer des versions localisées de vidéos, de podcasts ou de cours avec des voix plus naturelles et cohérentes entre les différentes langues.

L’avancée de l’entreprise réduit les coûts et accélère la localisation du contenu, mais elle augmente également les exigences en matière d’authenticité et de consentement. Cloner une voix à partir de quelques secondes d’audio est utile pour le doublage et l’accessibilité, bien que le même mécanisme facilite les usages abusifs en l’absence de permissions claires et de systèmes de détection adéquats.