Oggi rilasciamo Voxtral Transcribe 2, due modelli speech-to-text di nuova generazione con qualità di trascrizione allo stato dell’arte, diarizzazione e latenza ultra-bassa. La famiglia include Voxtral Mini Transcribe V2 per la trascrizione batch e Voxtral Realtime per applicazioni live. Voxtral Realtime è disponibile con pesi aperti con licenza Apache 2.0.
Stiamo inoltre lanciando un playground audio in Mistral Studio per testare subito la trascrizione, basato su Voxtral Transcribe 2, con diarizzazione e timestamp.
In evidenza.
Voxtral Mini Transcribe V2: trascrizione allo stato dell’arte con diarizzazione degli speaker, biasing contestuale e timestamp a livello di parola in 13 lingue.
Voxtral Realtime: progettato per la trascrizione live con latenza configurabile fino a meno di 200 ms, per abilitare agenti vocali e applicazioni in tempo reale.
Efficienza best-in-class: accuratezza leader di settore a una frazione del costo, con Voxtral Mini Transcribe V2 che raggiunge il tasso di errore sulle parole più basso al prezzo più basso.
Pesi aperti: Voxtral Realtime è distribuito con licenza Apache 2.0 ed è deployable su edge per applicazioni orientate alla privacy.
Voxtral Realtime.
Voxtral Realtime è progettato per applicazioni in cui la latenza è determinante. A differenza degli approcci che adattano modelli offline elaborando l’audio in chunk, Realtime usa una nuova architettura di streaming che trascrive l’audio man mano che arriva. Il modello fornisce trascrizioni con ritardo configurabile fino a meno di 200 ms, aprendo una nuova categoria di applicazioni voice-first.

Tasso di errore sulle parole (più basso è meglio) tra le lingue nel benchmark di trascrizione FLEURS.
Con un ritardo di 2,4 secondi, ideale per la sottotitolazione, Realtime eguaglia Voxtral Mini Transcribe V2, il nostro modello batch più recente. Con un ritardo di 480 ms, rimane entro l’1-2% di tasso di errore sulle parole, abilitando agenti vocali con accuratezza vicina a quella offline.
Il modello è nativamente multilingue e raggiunge prestazioni di trascrizione elevate in 13 lingue, tra cui inglese, cinese, hindi, spagnolo, arabo, francese, portoghese, russo, tedesco, giapponese, coreano, italiano e olandese. Con un footprint di 4B parametri, funziona in modo efficiente su dispositivi edge, garantendo privacy e sicurezza per deployment sensibili.
Rilasciamo i pesi del modello con licenza Apache 2.0 su Hugging Face Hub.
Voxtral Mini Transcribe V2.

Tasso medio di errore di diarizzazione (più basso è meglio) su cinque benchmark in inglese (Switchboard, CallHome, AMI-IHM, AMI-SDM, SBCSAE) e sul benchmark multilingue TalkBank (tedesco, spagnolo, inglese, cinese, giapponese).

Tasso medio di errore sulle parole (più basso è meglio) nelle prime 10 lingue del benchmark di trascrizione FLEURS.
Voxtral Mini Transcribe V2 offre miglioramenti significativi nella qualità della trascrizione e della diarizzazione tra lingue e domini. Con circa il 4% di tasso di errore sulle parole su FLEURS e $0.003/min, Voxtral offre il miglior rapporto prezzo-prestazioni di qualsiasi API di trascrizione. Supera GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal e Deepgram Nova in accuratezza, ed elabora l’audio circa 3 volte più velocemente rispetto a Scribe v2 di ElevenLabs, a parità di qualità e a un quinto del costo.
Funzionalità del modello.
Voxtral Mini Transcribe 2 introduce capacità chiave.
Diarizzazione degli speaker.
Genera trascrizioni con etichette degli speaker e tempi di inizio/fine precisi. Ideale per la trascrizione di riunioni, l’analisi di interviste e l’elaborazione di chiamate multiparte. Nota: in caso di parlato sovrapposto, il modello in genere trascrive uno speaker.
Biasing contestuale.
Fornisca fino a 100 parole o frasi per guidare il modello verso la grafia corretta di nomi, termini tecnici o vocabolario specifico di dominio. Particolarmente utile per nomi propri o terminologia di settore che i modelli standard spesso non riconoscono. Il biasing contestuale è ottimizzato per l’inglese; il supporto per altre lingue è sperimentale.
Timestamp a livello di parola.
Genera timestamp precisi di inizio e fine per ogni parola, abilitando applicazioni come la generazione di sottotitoli, la ricerca audio e l’allineamento dei contenuti.
Supporto linguistico esteso.
Come Realtime, questo modello ora supporta 13 lingue: inglese, cinese, hindi, spagnolo, arabo, francese, portoghese, russo, tedesco, giapponese, coreano, italiano e olandese. Le prestazioni nelle lingue diverse dall’inglese superano nettamente quelle dei competitor.
Robustezza al rumore.
Mantiene l’accuratezza della trascrizione in ambienti acustici complessi, come reparti di fabbrica, call center affollati e registrazioni sul campo.
Supporto per audio più lunghi.
Elabora registrazioni fino a 3 ore in una singola richiesta.

Tasso di errore sulle parole (più basso è meglio) tra le lingue nel benchmark di trascrizione FLEURS.
Playground audio.
Testi Voxtral Transcribe 2 direttamente in Mistral Studio. Carichi fino a 10 file audio, abiliti o disabiliti la diarizzazione, scelga la granularità dei timestamp e aggiunga termini di biasing contestuale per vocabolario specifico di dominio. Supporta .mp3, .wav, .m4a, .flac, .ogg fino a 1 GB ciascuno.
Trasformare le applicazioni vocali.
Voxtral alimenta workflow vocali in applicazioni e settori diversi.
Meeting intelligence.
Trascriva registrazioni multilingue con diarizzazione degli speaker, attribuendo chiaramente chi ha detto cosa e quando. Al prezzo di Voxtral, è possibile annotare grandi volumi di contenuti di meeting con un’efficienza dei costi leader di settore.Agenti vocali e assistenti virtuali.
Crei AI conversazionale con latenza di trascrizione inferiore a 200 ms. Colleghi Voxtral Realtime alla Sua pipeline LLM e TTS per interfacce vocali reattive e naturali.Automazione dei contact center.
Trascriva le chiamate in tempo reale, consentendo ai sistemi AI di analizzare il sentiment, suggerire risposte e popolare i campi CRM mentre le conversazioni sono ancora in corso. La diarizzazione degli speaker garantisce un’attribuzione chiara tra agenti e clienti.Media e broadcast.
Generi sottotitoli multilingue live con latenza minima. Il biasing contestuale gestisce nomi propri e terminologia tecnica che mettono in difficoltà i servizi di trascrizione generici.Compliance e documentazione.
Monitori e trascriva le interazioni per la conformità normativa, con la diarizzazione che offre una chiara attribuzione degli speaker e i timestamp che abilitano audit trail precisi.
Entrambi i modelli supportano deployment conformi a GDPR e HIPAA tramite configurazioni on-premise sicure o cloud privato.
Per iniziare.
Voxtral Mini Transcribe V2 è ora disponibile via API a $0.003 al minuto. Lo provi ora nel nuovo Mistral Studio playground audio o in Le Chat.
Voxtral Realtime è disponibile via API a $0.006 al minuto e come pesi aperti su Hugging Face.
Esplori la documentazione sulle capacità audio e di trascrizione di Mistral.
Stiamo assumendo.
Se La entusiasma costruire speech AI di livello mondiale e mettere modelli all’avanguardia nelle mani degli sviluppatori ovunque, ci farebbe piacere ricevere la Sua candidatura. Si candidi per unirsi al nostro team.
Voxtral Mini Transcribe 2
Premier
State-of-the-art batch audio transcription.
Trascrizione
Voce
Leggero
Audio Input/min
$0.003
Available on
/v1/audio/transcriptions
Voxtral Mini Transcribe Realtime
Open
Open model fine-tuned and optimized for transcription.
Trascrizione
Voce
Audio Input/min
$0.006
Available on
/v1/audio/transcriptions




