Mixtral 8x22B è il nostro ultimo modello open. Stabilisce un nuovo standard di prestazioni ed efficienza nella community AI. È un modello sparse Mixture-of-Experts (SMoE) che utilizza solo 39B parametri attivi su 141B, offrendo un’efficienza di costo senza pari per le sue dimensioni.
Mixtral 8x22B offre i seguenti punti di forza:
È fluente in inglese, francese, italiano, tedesco e spagnolo
Dispone di solide capacità in matematica e coding
Supporta nativamente il function calling; insieme alla modalità di output vincolato implementata su la Plateforme, consente lo sviluppo di applicazioni e la modernizzazione degli stack tecnologici su larga scala
La sua context window da 64K token consente un richiamo preciso delle informazioni da documenti di grandi dimensioni
Veramente open
Crediamo nel potere dell’apertura e di un’ampia distribuzione per promuovere innovazione e collaborazione nell’AI.
Pertanto, rilasciamo Mixtral 8x22B sotto Apache 2.0, la licenza open source più permissiva, che consente a chiunque di utilizzare il modello ovunque e senza restrizioni.
Efficienza ai massimi livelli
Costruiamo modelli che offrono un’efficienza di costo senza pari per le rispettive dimensioni, garantendo il miglior rapporto prestazioni-costo tra i modelli forniti dalla community.
Mixtral 8x22B è la naturale prosecuzione della nostra famiglia di modelli open. I suoi pattern di attivazione sparse lo rendono più veloce di qualsiasi modello dense 70B, pur essendo più capace di qualsiasi altro modello open-weight (distribuito con licenze permissive o restrittive). La disponibilità del modello base lo rende un’eccellente base per casi d’uso di fine-tuning.

Figura 1: Misura del compromesso tra prestazioni (MMLU) e budget di inferenza (numero di parametri attivi). Mistral 7B, Mixtral 8x7B e Mixtral 8x22B appartengono tutti a una famiglia di modelli altamente efficienti rispetto agli altri modelli open.
Prestazioni open senza pari
Di seguito è riportato un confronto tra modelli open su benchmark standard di settore.
Ragionamento e conoscenza
Mixtral 8x22B è ottimizzato per il ragionamento.

Figura 2: Prestazioni sui benchmark diffusi di common sense, ragionamento e conoscenza dei principali modelli LLM open: MMLU (Measuring massive multitask language in understanding), HellaSwag (10-shot), Wino Grande (5-shot), Arc Challenge (5-shot), Arc Challenge (25-shot), TriviaQA (5-shot) e NaturalQS (5-shot).
Capacità multilingue
Mixtral 8x22B dispone di capacità multilingue native. Supera nettamente LLaMA 2 70B nei benchmark HellaSwag, Arc Challenge e MMLU in francese, tedesco, spagnolo e italiano.

Figura 3: Confronto tra i modelli open source di Mistral e LLaMA 2 70B su HellaSwag, Arc Challenge e MMLU in francese, tedesco, spagnolo e italiano.
Matematica e coding
Mixtral 8x22B offre le migliori prestazioni nei task di coding e matematica rispetto agli altri modelli open.

Figura 4: Prestazioni sui benchmark più diffusi di coding e matematica dei principali modelli open: HumanEval pass@1, MBPP pass@1, GSM8K maj@1 (5 shot), GSM8K maj@8 (8-shot) e Math maj@4.
La versione instructed di Mixtral 8x22B rilasciata oggi mostra prestazioni matematiche ancora migliori, con un punteggio del 90,8% su GSM8K maj@8 e un punteggio Math maj@4 del 44,6%.
Scopra subito Mixtral 8x22B su la Plateforme e si unisca alla community di developer Mistral mentre definiamo insieme l’avanguardia dell’AI.




