
Voce: l’interfaccia utente originale.
La voce è stata la prima interfaccia dell’umanità: molto prima della scrittura o della digitazione, ci ha permesso di condividere idee, coordinare il lavoro e costruire relazioni. Man mano che i sistemi digitali diventano più capaci, la voce torna a essere la forma più naturale di interazione uomo-computer.
Tuttavia, i sistemi attuali restano limitati: poco affidabili, proprietari e troppo fragili per l’uso nel mondo reale. Colmare questo divario richiede strumenti con trascrizione eccezionale, comprensione profonda, fluidità multilingue e deployment aperto e flessibile.
Rilasciamo i modelli Voxtral per accelerare questo futuro. Questi modelli di speech understanding all’avanguardia sono disponibili in due dimensioni: una variante 24B per applicazioni su scala di produzione e una variante 3B per deployment locali ed edge. Entrambe le versioni sono rilasciate con licenza Apache 2.0 e sono disponibili anche sulla nostra API. L’API indirizza le query di trascrizione a una versione di Voxtral Mini ottimizzata per la trascrizione (Voxtral Mini Transcribe), che offre un’efficienza senza pari in termini di costo e latenza. Per una comprensione completa della ricerca e dello sviluppo alla base di Voxtral, consulti il nostro research paper dettagliato, scaricabile qui.
Speech understanding aperto, accessibile e pronto per la produzione, per tutti.
Fino a poco tempo fa, ottenere una speech intelligence davvero utilizzabile in produzione significava scegliere tra due compromessi:
Sistemi ASR open source con tassi di errore sulle parole elevati e comprensione semantica limitata
API chiuse e proprietarie che combinano una trascrizione solida con la comprensione linguistica, ma a costi significativamente più elevati e con meno controllo sul deployment
Voxtral colma questo divario. Offre accuratezza all’avanguardia e comprensione semantica nativa in modalità aperta, a meno della metà del prezzo di API comparabili. Questo rende la speech intelligence di alta qualità accessibile e controllabile su larga scala.
Entrambi i modelli Voxtral vanno oltre la semplice trascrizione con capacità che includono:
Contesto long-form: con una lunghezza di contesto di 32k token, Voxtral gestisce audio fino a 30 minuti per la trascrizione o 40 minuti per la comprensione
Q&A e sintesi integrati: supporta domande poste direttamente sul contenuto audio o la generazione di sintesi strutturate, senza dover concatenare modelli ASR e modelli linguistici separati
Nativamente multilingue: rilevamento automatico della lingua e prestazioni all’avanguardia nelle lingue più utilizzate al mondo (inglese, spagnolo, francese, portoghese, hindi, tedesco, olandese, italiano, per citarne alcune), aiutando i team a servire audience globali con un unico sistema
Function calling direttamente dalla voce: consente l’attivazione diretta di funzioni backend, workflow o chiamate API in base agli intenti vocali dell’utente, trasformando le interazioni vocali in comandi di sistema azionabili senza passaggi intermedi di parsing.
Altamente capace sul testo: conserva le capacità di comprensione del testo del backbone del suo modello linguistico, Mistral Small 3.1
Queste capacità rendono i modelli Voxtral ideali per interazioni nel mondo reale e azioni downstream, come sintesi, risposte, analisi e insight. Per i casi d’uso sensibili ai costi, Voxtral Mini Transcribe supera OpenAI Whisper a meno della metà del prezzo. Per i casi d’uso premium, Voxtral Small eguaglia le prestazioni di ElevenLabs Scribe, sempre a meno della metà del prezzo.
Benchmark
Trascrizione vocale
Per valutare le capacità di trascrizione di Voxtral, lo misuriamo su una serie di benchmark in inglese e multilingue. Per ogni task, riportiamo il tasso di errore sulle parole macro-medio (più basso è, meglio è) tra le lingue. Per l’inglese, riportiamo una media short-form (<30 secondi) e long-form (>30 secondi).
Voxtral supera ampiamente Whisper large-v3, l’attuale modello open source leader per la trascrizione vocale. Batte GPT-4o mini Transcribe e Gemini 2.5 Flash su tutti i task e raggiunge risultati all’avanguardia su short-form in inglese e Mozilla Common Voice, superando ElevenLabs Scribe e dimostrando solide capacità multilingue.

Quando viene valutato tra le lingue in FLEURS, Voxtral Small supera Whisper in ogni task, raggiungendo prestazioni all’avanguardia in diverse lingue europee.

Dettagli della macro-media:
En short-form: LibriSpeech Clean, LibriSpeech Other, GigaSpeech, VoxPopuli, Switchboard, CHiME-4, SPGISpeech
En long-form: Earnings-21 10-m, Earnings-22 10-m
Mozilla Common Voice 15.1: inglese, francese, tedesco, spagnolo, italiano, portoghese, olandese, hindi
FLEURS: inglese, francese, tedesco, spagnolo, italiano, portoghese, olandese, hindi, arabo
Comprensione audio
Voxtral Small e Mini sono in grado di rispondere a domande direttamente dal parlato, oppure fornendo un audio e un prompt testuale. Per valutare le capacità di comprensione audio, creiamo versioni sintetizzate vocalmente di tre task comuni di comprensione del testo. Valutiamo inoltre i modelli su un benchmark interno di comprensione audio (AU), in cui al modello viene chiesto di rispondere a domande complesse su 40 esempi audio long-form. Infine, valutiamo le capacità di traduzione vocale sul benchmark FLEURS-Translation.
Voxtral Small è competitivo con GPT-4o-mini e Gemini 2.5 Flash su tutti i task, raggiungendo prestazioni all’avanguardia nella traduzione vocale.

Testo
Voxtral conserva le capacità testuali del suo backbone Language Model, permettendo di usarlo come sostituto drop-in rispettivamente di Ministral e Mistral Small 3.1.

Provi gratuitamente
Che stia prototipando su un laptop, eseguendo workload privati on-premises o scalando in produzione nel cloud, iniziare è semplice.
Scarichi ed esegua localmente: sia Voxtral (24B) sia Voxtral Mini (3B) sono disponibili per il download su Hugging Face
Provi l’API: integri speech intelligence all’avanguardia nella sua applicazione con una singola chiamata API. Il pricing parte da $0.001 al minuto, rendendo trascrizione e comprensione di alta qualità accessibili su larga scala. Consulti la nostra documentazione qui.
Provi su Le Chat: provi Voxtral in modalità voce in Le Chat (in rollout per tutti gli utenti nelle prossime due settimane), su web o mobile. Registri o carichi audio, ottenga trascrizioni, faccia domande o generi sintesi.
Funzionalità enterprise avanzate.
Offriamo anche capacità per Voxtral progettate per aziende con requisiti più elevati di sicurezza, scalabilità o specializzazione di dominio. La invitiamo a contattarci se sta valutando:
Deployment privato su scala di produzione: il nostro team Solutions può aiutarla a configurare Voxtral per inferenza su scala di produzione interamente all’interno della sua infrastruttura. È ideale per casi d’uso in settori regolamentati con requisiti rigorosi di privacy dei dati. Include guida e tooling per distribuire Voxtral su più GPU o nodi, con build quantizzate ottimizzate per throughput di produzione ed efficienza dei costi.
Fine-tuning specifico per dominio: collabori con il nostro team di AI applicata per adattare Voxtral a contesti specializzati, come ambito legale, medico, customer support o knowledge base interne, migliorando l’accuratezza per il suo caso d’uso.
Contesto avanzato: invitiamo design partner a costruire il supporto per identificazione dello speaker, rilevamento delle emozioni, diarizzazione avanzata e finestre di contesto ancora più lunghe, per soddisfare una gamma più ampia di esigenze out of the box.
Supporto dedicato per l’integrazione: accesso prioritario a risorse di engineering e consulenza per integrare Voxtral in modo pulito nei suoi workflow, prodotti o data pipeline esistenti.
In arrivo.
Organizzeremo un webinar live con i nostri amici di Inworld (dia un’occhiata alla loro interessante demo speech-to-speech con Voxtral e Inworld TTS) per mostrare come costruire agenti voice-powered end-to-end mercoledì 6 agosto. Se è interessato, si registri qui.
Stiamo lavorando per rendere le nostre capacità audio più ricche di funzionalità nei prossimi mesi. Oltre alla comprensione vocale, presto supporteremo:
Segmentazione degli speaker
Annotazioni audio come età ed emozione
Timestamp a livello di parola
Riconoscimento di audio non vocale
E altro ancora.
Siamo impazienti di vedere cosa costruirà con Voxtral.
A proposito, stiamo assumendo.
Il rilascio dei nostri modelli Voxtral segna un importante passo avanti, ma il nostro percorso è tutt’altro che concluso. La nostra ambizione è costruire le interfacce vocali più naturali, piacevoli e vicine all’essere umano, e c’è ancora molto lavoro da fare. Stiamo ampliando attivamente il nostro nascente team audio e cerchiamo research scientist e ingegneri di talento che condividano la nostra ambizione.
Se desidera unirsi a noi nella nostra missione di democratizzare l’intelligenza artificiale, accogliamo con interesse la sua candidatura per entrare nel nostro team.




