Soluzioni

Parlando di Voxtral

March 23, 2026

By Mistral AI

Summary

Mistral AI ha lanciato Voxtral TTS, un modello text-to-speech da 4B parametri che offre generazione vocale multilingue all’avanguardia, con parlato realistico ed emotivamente espressivo in 9 lingue, bassa latenza e facile adattamento vocale. Il modello eccelle nella comprensione contestuale, nella modellazione dello speaker e nell’adattamento vocale cross-lingual zero-shot, rendendolo ideale per workflow vocali enterprise e agent AI scalabili. Disponibile tramite API e Mistral Studio, offre generazione vocale di alta qualità ed economicamente efficiente a partire da 0,016 $ per 1k caratteri.

Oggi rilasciamo Voxtral TTS, il nostro primo modello text-to-speech con prestazioni all’avanguardia nella generazione vocale multilingue. Il modello è leggero, con 4B di parametri, rendendo gli agent basati su Voxtral naturali, affidabili ed economicamente efficienti su larga scala.

In evidenza.

  1. Voce realistica ed emotivamente espressiva in 9 lingue diffuse, con supporto per diversi dialetti.

  2. Latenza molto bassa per il time-to-first-audio.

  3. Facilmente adattabile a nuove voci.

  4. Disponibile per la prova in Mistral Studio.

  5. Text-to-speech di livello enterprise, a supporto di workflow critici per voice agent.

Una generazione vocale naturale dipende dalla capacità del modello non solo di leggere un testo, ma di interpretarlo con precisione. La comprensione contestuale, ad esempio neutra, felice, sarcastica e così via, determina se chi ascolta percepisce la generazione come accurata o robotica. Il nostro modello eccelle sia nella comprensione contestuale sia nella modellazione dello speaker: cattura il modo in cui una persona specifica parla naturalmente. Il nostro adattamento vocale va oltre il tradizionale read-speech, catturando la personalità dello speaker, comprese pause naturali, ritmo, intonazione e destrezza emotiva. Grazie a dimensioni compatte, costi e latenza ridotti e facile adattabilità, Voxtral TTS offre pieno controllo e personalizzazione alle aziende che vogliono possedere il proprio stack di voice AI.

L’audio è la nuova UX. Crei nuove interazioni per collaborazione e comprensione, possibili solo nel parlato. Inizi ora in AI Studio con le nostre Mistral Voices nei dialetti americano, britannico e francese.


Ascolti e decida: riesce a cogliere la differenza?

Il nostro team parla decine di lingue in molteplici dialetti; comprendiamo l’importanza delle sfumature culturali e abbiamo costruito un modello che ci rispecchia. La generazione del parlato crea fiducia attraverso ritmo naturale, emozione e persino uso dell’umorismo. Per questo, con l’emulazione vocale, ci siamo concentrati su autenticità ed espressività emotiva.

Voice emulation

Original voice

Margaret

Margaret

Model Behavior Architect

English (US)

Emulation

Prompt

Boy oh boy! I'm so excited for the summer. It's going to be so warm here, can't wait for swimming in the Lido and making cherry pie.

Provider 1
Provider 2

Prestazioni all’avanguardia.

Metriche automatizzate come word-error-rate e punteggi di qualità audio per sistemi text-to-speech multilingue non sono in grado di misurare la naturalezza del parlato. Ciò che rende naturale il parlato è estremamente sfumato e richiede una profonda comprensione delle differenze culturali e dei pattern di conversazione tipici. Per questo, le valutazioni umane comparative condotte da madrelingua sono cruciali.

Per i voice agent, latenza e qualità sono in costante tensione. Le valutazioni umane mostrano che Voxtral TTS raggiunge una naturalezza superiore rispetto a ElevenLabs Flash v2.5, mantenendo al contempo un Time-to-First-Audio (TTFA) simile. Voxtral offre inoltre una qualità in linea con ElevenLabs v3, supportando con successo l’emotion-steering per interazioni più realistiche.

Voxtral TTS Winrate (1)

Abbiamo condotto una valutazione umana comparativa di Voxtral TTS e ElevenLabs v2.5 Flash in un contesto di voce custom zero-shot. Utilizzando due voci riconoscibili nei rispettivi dialetti nativi per ciascuna delle 9 lingue supportate, 3 annotatori hanno eseguito un test di preferenza side-by-side per ogni coppia su naturalezza, aderenza all’accento e somiglianza acustica con il riferimento originale. Voxtral TTS amplia il divario qualitativo rispetto a v2.5 Flash in questo scenario di voce custom multilingue zero-shot, evidenziando la personalizzabilità istantanea di Voxtral TTS per qualsiasi voce.

Parlato nativo.

Addestrato su un ampio dataset di parlato, Voxtral TTS è progettato per applicazioni globali. Supporta prestazioni all’avanguardia in 9 lingue: inglese, francese, tedesco, spagnolo, olandese, portoghese, italiano, hindi e arabo.

Il modello è stato addestrato per adattarsi a una voce custom con un riferimento di appena 3 secondi e catturare non solo la voce, ma anche sfumature come accento sottile, inflessioni, intonazioni e persino disfluenze simili a quelle espresse nel riferimento. Offriamo alcune opzioni vocali preset nell’API, ma è semplice estenderlo alla Sua libreria vocale interna, personalizzandolo in base al caso d’uso, localizzandolo per lingua e accento, mantenendolo neutro o più emotivo, casual o formale, più naturale e conversazionale oppure robotico.

Il modello dimostra inoltre adattamento vocale cross-lingual zero-shot, anche se non è stato addestrato esplicitamente per questo. Ad esempio, il modello può generare parlato in inglese con un voice prompt francese e testo inglese. Il parlato risultante suona naturale, adottando al contempo l’accento del voice prompt fornito: in questo esempio, il parlato generato presenta un inglese naturale con accento francese. Ciò rende il modello utile per costruire sistemi di traduzione speech-to-speech a cascata.

Cascaded speech-to-speech translation

Click a speaker to run cascaded speech-to-speech translation.

Prompt

Before we begin, I'll need to verify a few details. Can you confirm your full name and date of birth?

Generated Audio

Voxtral TTS

Progettato per streaming a bassa latenza.

La latenza è critica per le applicazioni di voice agent. Voxtral TTS raggiunge una latenza del modello di 70 ms per un tipico campione vocale di input di 10 secondi e 500 caratteri, con un real-time factor (RTF) di ≈9,7x. Il modello genera nativamente fino a due minuti di audio e la nostra API gestisce generazioni di lunghezza arbitraria con interleaving intelligente.

Architettura di Voxtral TTS.

Il modello è un modello autoregressivo basato su transformer e flow-matching, costruito su Ministral 3B. È composto dai seguenti componenti:

  • backbone transformer decoder da 3,4B di parametri

  • transformer acustico flow-matching da 390M

  • codec audio neurale da 300M (encoder-decoder simmetrico)

Il modello accetta un voice prompt (da 5 a 25 secondi) e un text prompt nelle 9 lingue supportate. Per ogni frame audio, il backbone transformer predice un token semantico; quindi il transformer flow-matching esegue 16 valutazioni di funzione (NFE) per produrre il latente acustico.

Abbiamo sviluppato un codec interno, che elabora l’audio in modo causale utilizzando un latente semantic VQ (vocabolario 8192) e acoustic FSQ (36 dim e 21 livelli), producendo tali latenti a un frame rate di 12,5 Hz.

Audio Infographic

A supporto dei workflow vocali enterprise.


Voxtral TTS chiude il ciclo dell’intelligenza audio, offrendo alle pipeline vocali enterprise un layer di output che supera il test umano. Funziona insieme a Voxtral Transcribe per uno speech-to-speech completo, oppure si integra in qualsiasi stack speech-to-text e LLM esistente, con supporto cross-lingual.

Workflows

Customer Support

Voice agents that route and resolve queries across channels with natural, brand-appropriate speech. Place Voxtral TTS into existing contact support call systems for automated spoken responses, with output that integrates into existing workflows.

Thank you for contacting support. I see your concern about the unexpected charge on March 22nd. Let me pull up your account details. Ah, yes. This appears to be a temporary hold for a subscription upgrade you requested. Would you like me to cancel the hold or adjust your plan? Your call is important to us, so I'll stay on the line until this is resolved.
Jane

Testi il modello in Mistral Studio.

Experiment con Voxtral TTS direttamente nel playground di Mistral Studio. Selezioni una delle voci Mistral oppure registri la Sua.

Inizi con Voxtral TTS.

Voxtral TTS è ora disponibile tramite API a 0,016 $ per 1k caratteri.

Lo provi ora in Mistral Studio o in Le Chat

Un modello con diverse voci di riferimento è disponibile come open weights su Hugging Face con licenza CC BY NC 4.0.

Esplori la documentazione del modello o legga il nostro research paper.

Si iscriva al nostro prossimo webinar per saperne di più. 

Stiamo assumendo.

Stiamo costruendo il voice layer per l’AI e, se questo è il tipo di problema su cui desidera lavorare, saremmo lieti di sentirLa.

Voxtral TTS

Open

Sintesi vocale (TTS) e voice cloning all’avanguardia.

Voce

Audio generation

$0.016

per 1k characters

Available on

/v1/audio/speech