Recherche

Voxtral transcrit à la vitesse du son.

February 4, 2026

By Mistral AI

Aujourd’hui, nous publions Voxtral Transcribe 2, deux modèles speech-to-text de nouvelle génération offrant une qualité de transcription à l’état de l’art, la diarisation et une latence ultra-faible. Cette famille comprend Voxtral Mini Transcribe V2 pour la transcription batch et Voxtral Realtime pour les applications en direct. Voxtral Realtime est disponible à poids ouverts sous licence Apache 2.0.

Nous lançons aussi un espace de test audio dans Mistral Studio pour tester la transcription instantanément avec Voxtral Transcribe 2, avec diarisation et timestamps.

Points clés.

  • Voxtral Mini Transcribe V2 : transcription à l’état de l’art avec diarisation des locuteurs, biaisage par contexte et timestamps au niveau des mots dans 13 langues.

  • Voxtral Realtime : conçu pour la transcription en direct, avec une latence configurable jusqu’à moins de 200 ms, pour les agents vocaux et les applications en temps réel.

  • Efficacité de premier plan : précision parmi les meilleures du secteur à une fraction du coût, Voxtral Mini Transcribe V2 atteignant le taux d’erreur mot le plus bas au prix le plus bas.

  • Poids ouverts : Voxtral Realtime est fourni sous Apache 2.0 et déployable en edge pour les applications qui privilégient la confidentialité.

Voxtral Realtime.

Voxtral Realtime est conçu pour les applications où la latence compte. Contrairement aux approches qui adaptent des modèles hors ligne en traitant l’audio par fragments, Realtime utilise une nouvelle architecture de streaming qui transcrit l’audio au fil de son arrivée. Le modèle fournit des transcriptions avec un délai configurable jusqu’à moins de 200 ms, ce qui ouvre une nouvelle catégorie d’applications vocales.

Fleur Voxtral 2

Taux d’erreur mot, où une valeur plus basse est meilleure, par langue dans le benchmark de transcription FLEURS.

Avec un délai de 2,4 secondes, idéal pour le sous-titrage, Realtime atteint le niveau de Voxtral Mini Transcribe V2, notre dernier modèle batch. Avec un délai de 480 ms, il reste dans une plage de 1 à 2 % de taux d’erreur mot, ce qui permet de créer des agents vocaux avec une précision proche du mode hors ligne.

Le modèle est nativement multilingue et offre de solides performances de transcription dans 13 langues, dont l’anglais, le chinois, l’hindi, l’espagnol, l’arabe, le français, le portugais, le russe, l’allemand, le japonais, le coréen, l’italien et le néerlandais. Avec une empreinte de 4 milliards de paramètres, il s’exécute efficacement sur des appareils edge, pour garantir la confidentialité et la sécurité dans les déploiements sensibles.

Nous publions les poids du modèle sous Apache 2.0 sur le Hugging Face Hub.

Voxtral Mini Transcribe V2.

Voxtral 2.0   Avg Diarization Error Rate   Priceper Min

Taux d’erreur de diarisation moyen, où une valeur plus basse est meilleure, sur cinq benchmarks anglais (Switchboard, CallHome, AMI-IHM, AMI-SDM, SBCSAE) et le benchmark multilingue TalkBank (allemand, espagnol, anglais, chinois, japonais).

Voxtral 2.0   Transcription Performance Fleurs   Priceper Min

Taux d’erreur mot moyen, où une valeur plus basse est meilleure, sur les 10 principales langues du benchmark de transcription FLEURS.

Voxtral Mini Transcribe V2 améliore nettement la qualité de transcription et de diarisation dans plusieurs langues et domaines. Avec environ 4 % de taux d’erreur mot sur FLEURS et 0,003 $/min, Voxtral offre le meilleur rapport prix-performance parmi les API de transcription. Il dépasse GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal et Deepgram Nova en précision, et traite l’audio environ 3 fois plus vite que Scribe v2 d’ElevenLabs, avec une qualité équivalente pour un cinquième du coût.

Fonctionnalités du Modèle.

Voxtral Mini Transcribe 2 introduit des capacités clés.

Diarisation des locuteurs.

Générez des transcriptions avec des étiquettes de locuteurs et des heures de début et de fin précises. Idéal pour la transcription de réunions, l’analyse d’entretiens et le traitement d’appels à plusieurs participants. Remarque : lorsque plusieurs personnes parlent en même temps, le modèle transcrit généralement un seul locuteur.

Biaisage par Contexte.

Fournissez jusqu’à 100 mots ou expressions pour guider le modèle vers l’orthographe correcte de noms, de termes techniques ou de vocabulaire propre à un domaine. C’est particulièrement utile pour les noms propres ou la terminologie métier que les modèles standard manquent souvent. Le biaisage par contexte est optimisé pour l’anglais ; la prise en charge de d’autres langues est expérimentale.

Timestamps au niveau des mots.

Générez des timestamps de début et de fin précis pour chaque mot, ce qui permet de créer des applications comme la génération de sous-titres, la recherche audio et l’alignement de contenu.

Prise en charge étendue des langues.

Comme Realtime, ce modèle prend désormais en charge 13 langues : anglais, chinois, hindi, espagnol, arabe, français, portugais, russe, allemand, japonais, coréen, italien et néerlandais. Ses performances hors anglais dépassent nettement celles des concurrents.

Robustesse au bruit.

Maintient la précision de transcription dans des environnements acoustiques difficiles, comme les ateliers de production, les centres d’appels très sollicités et les enregistrements de terrain.

Prise en charge des fichiers audio plus longs.

Traitez des enregistrements jusqu’à 3 heures dans une seule requête.

FlEURS

Taux d’erreur mot, où une valeur plus basse est meilleure, par langue dans le benchmark de transcription FLEURS.

Espace de test audio.

Testez Voxtral Transcribe 2 directement dans Mistral Studio. Vous pouvez télécharger jusqu’à 10 fichiers audio, activer l’interrupteur de diarisation, choisir la granularité des timestamps et ajouter des termes de biaisage par contexte pour le vocabulaire propre à un domaine. Prend en charge les formats .mp3, .wav, .m4a, .flac et .ogg, jusqu’à 1 Go par fichier.

Transformer les applications vocales.

Voxtral alimente des workflows vocaux dans de nombreux cas d’usage et secteurs.

  • Intelligence de réunion.

    Transcrivez des enregistrements multilingues avec une diarisation des locuteurs qui attribue clairement qui a dit quoi et quand. Au niveau de prix de Voxtral, vous pouvez annoter de grands volumes de contenu de réunion avec une efficacité de coût parmi les meilleures du secteur.

  • Agents vocaux et assistants virtuels.

    Créez une IA conversationnelle avec une latence de transcription inférieure à 200 ms. Connecter Voxtral Realtime à votre pipeline LLM et TTS pour obtenir des interfaces vocales réactives et naturelles.

  • Automatisation des centres de contact.

    Transcrivez les appels en temps réel pour permettre aux systèmes d’IA d’analyser le sentiment, de suggérer des réponses et de remplir des champs CRM pendant que les conversations sont encore en cours. La diarisation des locuteurs garantit une attribution claire entre agents et clients.

  • Médias et diffusion.

    Générez des sous-titres multilingues en direct avec une latence minimale. Le biaisage par contexte gère les noms propres et la terminologie technique qui mettent en défaut les services de transcription génériques.

  • Conformité et documentation.

    Surveillez et transcrivez les interactions pour la conformité réglementaire, avec une diarisation qui fournit une attribution claire des locuteurs et des timestamps qui permettent des pistes d’audit précises.

Les deux modèles permettent des déploiements conformes au RGPD et à la HIPAA via des configurations sécurisées sur site ou dans un cloud privé.

Démarrer.

Voxtral Mini Transcribe V2 est disponible dès maintenant via API à 0,003 $ par minute. Essayez-le maintenant dans le nouvel espace de test audio de Mistral Studio ou dans Le Chat.

Voxtral Realtime est disponible via API à 0,006 $ par minute et sous forme de poids ouverts sur Hugging Face.

Explorez la documentation sur les capacités audio et de transcription de Mistral.

Nous recrutons.

Si vous souhaitez construire une IA vocale de premier plan et mettre des modèles de pointe entre les mains des développeurs partout dans le monde, nous aimerions vous lire. Postulez pour rejoindre notre équipe.

Voxtral Mini Transcribe 2

Premier

State-of-the-art batch audio transcription.

Transcription

Voice

Lightweight

Audio Input/min

$0.003

Available on

/v1/audio/transcriptions

Voxtral Mini Transcribe Realtime

Open

Open model fine-tuned and optimized for transcription.

Transcription

Voice

Audio Input/min

$0.006

Available on

/v1/audio/transcriptions