Thinking
Summary
Mistral AI lance Voxtral TTS, un modèle de synthèse vocale de 4 milliards de paramètres qui offre une génération vocale multilingue de pointe, avec une parole réaliste et expressive sur le plan émotionnel dans neuf langues, une faible latence et une adaptation vocale simple. Le modèle excelle en compréhension contextuelle, en modélisation du locuteur et en adaptation vocale cross-lingue zero-shot, ce qui le rend adapté aux workflows vocaux d’entreprise et aux agents d’IA à grande échelle. Disponible via API et Mistral Studio, il propose une génération vocale rentable et de haute qualité à partir de 0,016 $ pour 1 000 caractères.
Nous lançons aujourd’hui Voxtral TTS, notre premier modèle de synthèse vocale avec des performances de pointe en génération vocale multilingue. Le modèle est léger, avec 4 milliards de paramètres, ce qui rend les agents basés sur Voxtral naturels, fiables et rentables à grande échelle.
Points clés.
Voix réaliste et expressive sur le plan émotionnel dans neuf langues courantes, avec prise en charge de dialectes variés.
Latence très faible avant le premier audio.
Adaptation simple à de nouvelles voix.
Disponible en test dans Mistral Studio.
Synthèse vocale de niveau entreprise pour les workflows critiques d’agents vocaux.
Une génération vocale naturelle dépend de la capacité du modèle à réciter un texte, mais aussi à l’interpréter avec précision. La compréhension contextuelle — ton neutre, joyeux, sarcastique, etc. — détermine si l’auditeur perçoit la génération comme juste ou robotique. Notre modèle excelle à la fois en compréhension contextuelle et en modélisation du locuteur : il capture la manière dont une personne parle naturellement. Notre adaptation vocale va au-delà de la lecture traditionnelle en capturant la personnalité du locuteur, notamment ses pauses naturelles, son rythme, son intonation et sa souplesse émotionnelle. Grâce à sa taille compacte, son faible coût, sa faible latence et sa capacité d’adaptation, Voxtral TTS donne aux entreprises la maîtrise et la personnalisation nécessaires pour contrôler leur stack d’IA vocale.
L’audio devient la nouvelle UX. Créez de nouvelles interactions de collaboration et de compréhension propres à la parole. Commencez dès maintenant dans AI Studio avec nos voix Mistral en dialectes américain, britannique et français.
Écoutez et décidez : pouvez-vous faire la différence ?
Notre équipe parle des dizaines de langues dans plusieurs dialectes. Nous comprenons l’importance des nuances culturelles et avons construit un modèle qui nous ressemble. La génération vocale crée de la confiance grâce à un rythme naturel, à l’émotion et même à l’usage de l’humour. C’est pourquoi, avec l’émulation vocale, nous nous sommes concentrés sur l’authenticité et l’expressivité émotionnelle.
Voice emulation
Original voice
Margaret
Model Behavior Architect
English (US)
Prompt
Boy oh boy! I'm so excited for the summer. It's going to be so warm here, can't wait for swimming in the Lido and making cherry pie.
Performances de pointe.
Les métriques automatisées, comme le taux d’erreur de mots et les scores de qualité audio pour les systèmes de synthèse vocale multilingues, ne mesurent pas le naturel de la parole. Ce qui rend une voix naturelle est très nuancé et exige une compréhension fine des différences culturelles et des habitudes de parole. Les évaluations humaines comparatives menées par des locuteurs natifs sont donc essentielles.
Pour les agents vocaux, latence et qualité sont en tension permanente. Les évaluations humaines montrent que Voxtral TTS atteint un naturel supérieur à ElevenLabs Flash v2.5 tout en maintenant un Time-to-First-Audio (TTFA) similaire. Voxtral atteint aussi un niveau de qualité comparable à ElevenLabs v3, avec prise en charge réussie du pilotage de l’émotion pour des interactions plus réalistes.

Nous avons mené une évaluation humaine comparative de Voxtral TTS et ElevenLabs v2.5 Flash dans un contexte de voix personnalisée zero-shot. Pour chacune des neuf langues prises en charge, nous avons utilisé deux voix reconnaissables dans leurs dialectes natifs. Trois annotateurs ont réalisé un test de préférence côte à côte pour chaque paire, en évaluant le naturel, le respect de l’accent et la similarité acoustique avec la référence originale. Voxtral TTS creuse l’écart de qualité avec v2.5 Flash dans ce contexte de voix personnalisée multilingue zero-shot, ce qui montre la personnalisation instantanée de Voxtral TTS pour n’importe quelle voix.
Comme une langue maternelle.
Entraîné sur un vaste jeu de données vocales, Voxtral TTS est conçu pour un usage mondial. Il prend en charge des performances de pointe dans neuf langues : anglais, français, allemand, espagnol, néerlandais, portugais, italien, hindi et arabe.
Le modèle a été entraîné pour s’adapter à une voix personnalisée à partir d’une référence de seulement 3 s et pour capturer non seulement la voix, mais aussi des nuances comme un accent subtil, des inflexions, des intonations et même des disfluences similaires à celles exprimées dans la référence. Nous proposons quelques voix prédéfinies dans l’API, mais il est simple de l’étendre à votre Bibliothèque vocale interne, de l’adapter au cas d’usage, à la langue et à l’accent, et de choisir un rendu neutre ou plus expressif, informel ou formel, plus naturel et conversationnel, ou plus robotique.
Le modèle démontre aussi une adaptation vocale cross-lingue zero-shot, même s’il n’a pas été explicitement entraîné pour cela. Par exemple, il peut générer de la parole en anglais à partir d’un prompt vocal français et d’un texte anglais. La voix obtenue semble naturelle tout en adoptant l’accent du prompt vocal fourni : dans cet exemple, l’anglais généré est naturellement marqué par un accent français. Le modèle est donc utile pour construire des systèmes de traduction parole-parole en cascade.
Cascaded speech-to-speech translation
Click a speaker to run cascaded speech-to-speech translation.
Prompt
Before we begin, I'll need to verify a few details. Can you confirm your full name and date of birth?
Generated Audio
Conçu pour le streaming à faible latence.
La latence est critique pour les applications d’agents vocaux. Voxtral TTS atteint une latence modèle de 70 ms pour un échantillon vocal d’entrée typique de 10 secondes et 500 caractères, avec un facteur temps réel (RTF) d’environ 9,7×. Le modèle génère nativement jusqu’à deux minutes d’audio, et notre API gère des générations de longueur arbitraire avec un entrelacement intelligent.
Architecture de Voxtral TTS.
Le modèle est un modèle autoregressif basé sur transformer et le flow matching, construit sur Ministral 3B. Il comprend les composants suivants :
Backbone de décodeur transformer de 3,4 milliards de paramètres
Transformer acoustique de flow matching de 390 millions de paramètres
Codec audio neuronal de 300 millions de paramètres (encodeur-décodeur symétrique)
Le modèle prend en entrée un prompt vocal de 5 à 25 secondes et un prompt textuel dans les neuf langues prises en charge. Pour chaque trame audio, le backbone transformer prédit un token sémantique, puis le transformer de flow matching exécute 16 évaluations de fonction (NFE) pour produire le latent acoustique.
Nous avons développé un codec interne qui traite l’audio de manière causale à l’aide d’un latent VQ sémantique (vocabulaire de 8 192) et d’un latent FSQ acoustique (36 dimensions et 21 niveaux), puis les produit à une fréquence de trame de 12,5 Hz.

Au service des workflows vocaux d’entreprise.
Voxtral TTS complète la chaîne d’intelligence audio en donnant aux pipelines vocaux d’entreprise une couche de sortie qui passe le test humain. Il fonctionne avec Voxtral Transcribe pour une chaîne parole-parole complète, ou s’intègre à n’importe quelle stack speech-to-text et LLM existante, avec prise en charge cross-lingue.
Workflows
Customer Support
Voice agents that route and resolve queries across channels with natural, brand-appropriate speech. Place Voxtral TTS into existing contact support call systems for automated spoken responses, with output that integrates into existing workflows.
Tester le modèle dans Mistral Studio.
Expérimentez avec Voxtral TTS directement dans le playground Mistral Studio. Sélectionnez l’une des voix Mistral ou enregistrez la vôtre.
Démarrer avec Voxtral TTS.
Voxtral TTS est disponible dès maintenant via API à 0,016 $ pour 1 000 caractères.
Essayez-le dès maintenant dans Mistral Studio ou dans Le Chat.
Un modèle avec plusieurs voix de référence est disponible à poids ouverts sur Hugging Face sous licence CC BY NC 4.0.
Explorez la documentation du modèle ou lisez notre article de recherche.
Inscrivez-vous à notre prochain webinar pour en savoir plus.
Nous recrutons.
Nous construisons la couche vocale de l’IA. Si ce type de problème vous intéresse, nous aimerions échanger avec vous.





