Oggi annunciamo Mistral Small 4. Questo modello è la nuova major release della famiglia Mistral Small. Mistral Small 4 è il primo modello Mistral a unificare le capacità dei nostri modelli di punta, Magistral per il ragionamento, Pixtral per il multimodale e Devstral per il coding agentico, in un unico modello versatile. Con Small 4, gli utenti non devono più scegliere tra un modello instruct rapido, un potente motore di ragionamento o un assistente multimodale: un solo modello ora offre tutte e tre le capacità, con effort di ragionamento configurabile ed efficienza best-in-class.
Mistral Small 4 viene rilasciato con licenza Apache 2.0, confermando il nostro impegno per un'AI aperta, accessibile e personalizzabile.
Un nuovo standard per modelli multimodali ottimizzati per il ragionamento
Mistral Small 4 è un modello ibrido ottimizzato per chat generale, coding, attività agentiche e ragionamento complesso. La sua architettura supporta input sia di testo sia di immagini, rendendolo versatile per un'ampia gamma di applicazioni. Con Mistral Small 4, ribadiamo il nostro impegno per i modelli open source e siamo orgogliosi di aderire alla NVIDIA Nemotron Coalition come membro fondatore, promuovendo collaborazione e innovazione nello sviluppo dell'AI.
Dettagli architetturali principali
Mixture of Experts (MoE): 128 esperti, con 4 attivi per token, per abilitare scaling e specializzazione efficienti.
119B di parametri totali, con 6B di parametri attivi per token (8B includendo embedding e layer di output).
Finestra di contesto da 256k, a supporto di interazioni lunghe e analisi documentale.
Effort di ragionamento configurabile: consente di alternare risposte rapide e a bassa latenza a output profondi e intensivi sul ragionamento.
Multimodalità nativa: accetta input sia di testo sia di immagini, sbloccando use case che spaziano dal parsing dei documenti all'analisi visiva.
Punti salienti delle prestazioni
Riduzione del 40% del tempo di completamento end-to-end (configurazione ottimizzata per la latenza).
3x più richieste al secondo (configurazione ottimizzata per il throughput) rispetto a Mistral Small 3.

Perché Mistral Small 4?
Capacità unificate
Mistral Small 4 consolida i punti di forza di Magistral (ragionamento), Devstral (coding agents) e Mistral Small (instruct) in un unico modello. Che Le serva un assistente chat, un partner per la ricerca o un agente di coding, Small 4 si adatta al Suo task, senza dover passare da un modello specializzato all'altro.
Ragionamento on demand
Con il nuovo parametro reasoning_effort, gli utenti possono regolare dinamicamente il comportamento del modello:
reasoning_effort="none": risposte rapide e leggere per le attività quotidiane, equivalenti allo stesso stile di chat di Mistral Small 3.2.reasoning_effort="high": ragionamento profondo, passo dopo passo, per problemi complessi, con verbosità equivalente ai precedenti modelli Magistral.

Efficienza di livello enterprise
Infrastruttura minima: 4x NVIDIA HGX H100, 2x NVIDIA HGX H200 o 1x NVIDIA DGX B200.
Configurazione consigliata: 4x NVIDIA HGX H100, 4x NVIDIA HGX H200 o 2x NVIDIA DGX B200 per prestazioni ottimali.
Mistral Small 4 è completamente open source. Lo può sottoporre a fine-tuning per attività specializzate o distribuirlo out of the box per un uso general-purpose. Grazie alla collaborazione con la community, è ora disponibile su vLLM, llama.cpp, SGLang, Transformers e altro ancora.
La realizzazione di modelli AI open source avanzati richiede un'ampia ottimizzazione. Grazie alla stretta collaborazione con NVIDIA, l'inferenza è stata ottimizzata sia per vLLM sia per SGLang open source, assicurando un serving efficiente e ad alto throughput in diversi scenari di deployment.
Figura: punteggio vs. lunghezza dell'output su tre benchmark. In alto: punteggi di accuratezza (più alto è meglio). In basso: lunghezza media dell'output in migliaia di caratteri (più breve è meglio).
Mistral Small 4 con ragionamento raggiunge punteggi competitivi, eguagliando o superando GPT-OSS 120B in tutti e tre i benchmark, generando al contempo output significativamente più brevi. Su AA LCR, Mistral Small 4 ottiene 0,72 con appena 1,6K caratteri, mentre i modelli Qwen richiedono 3,5-4x più output (5,8-6,1K) per prestazioni comparabili. Su LiveCodeBench, Mistral Small 4 supera GPT-OSS 120B producendo il 20% di output in meno. Questo gap di efficienza è rilevante nella pratica: output più brevi significano latenza inferiore, costi di inferenza ridotti e una migliore esperienza utente.
Per gli acquirenti enterprise:
L'efficienza per token incide direttamente su costi e scalabilità. I modelli che mantengono o migliorano le prestazioni quando le risposte diventano più lunghe riducono la necessità di interventi manuali, abbassano i costi operativi e assicurano una qualità costante, anche per attività complesse e ad alto impatto come la generazione di report, l'assistenza clienti o i workflow decisionali. I modelli di ragionamento ibridi offrono più valore massimizzando l'accuratezza senza aumenti proporzionali nell'uso delle risorse, risultando ideali per deployment su larga scala in cui prestazioni ed efficienza dei costi sono entrambe critiche.
Per i team tecnici e i data scientist:
Le prestazioni per token sono una metrica chiave per la selezione e l'ottimizzazione dei modelli. I modelli che scalano in modo efficiente consentono ai team di distribuire soluzioni per attività più lunghe e sfumate (ad esempio analisi dettagliate, ragionamento multi-step) senza sacrificare l'accuratezza né aumentare i costi computazionali. Questo comporta meno compromessi tra qualità e allocazione delle risorse, abilitando applicazioni basate sull'AI più innovative e affidabili. Semplifica inoltre il fine-tuning e l'integrazione, poiché la robustezza del modello riduce la necessità di regolazioni continue o sistemi di fallback.
Use case previsti
Mistral Small 4 è progettato per:
Sviluppatori: automazione del coding, esplorazione delle codebase e workflow agentici sul codice.
Aziende: assistenti chat generali, comprensione dei documenti e analisi multimodale.
Ricercatori: matematica, ricerca e attività di ragionamento complesso.
La licenza open source e l'architettura personalizzabile lo rendono ideale per fine-tuning e specializzazione.
Disponibilità
Mistral API e AI Studio
Gli sviluppatori possono prototipare Mistral Small 4 gratuitamente su accelerated computing NVIDIA all'indirizzo build.nvidia.com e, per il deployment in produzione, Mistral Small 4 è disponibile day-0 come NVIDIA NIM, offrendo inferenza ottimizzata e containerizzata out of the box. Può anche essere personalizzato con NVIDIA NeMo per il fine-tuning specifico di dominio.
La documentazione tecnica per i clienti è disponibile sul nostro AI Governance Hub
Per deployment enterprise, fine-tuning personalizzato o soluzioni on-premises, contatti il nostro team.
Il futuro dell'AI è aperto
Unificando capacità instruct, di ragionamento e multimodali, Mistral Small 4 semplifica l'integrazione dell'AI e consente agli utenti di affrontare una gamma più ampia di attività con un unico strumento adattabile, portando i vantaggi dell'AI open source a use case reali.





