Soluzioni

Più economico, migliore, più veloce, più forte

April 17, 2024

By Mistral AI team

Mixtral 8x22B è il nostro ultimo modello open. Stabilisce un nuovo standard di prestazioni ed efficienza nella community AI. È un modello sparse Mixture-of-Experts (SMoE) che utilizza solo 39B parametri attivi su 141B, offrendo un’efficienza di costo senza pari per le sue dimensioni.

Mixtral 8x22B offre i seguenti punti di forza:

  • È fluente in inglese, francese, italiano, tedesco e spagnolo

  • Dispone di solide capacità in matematica e coding

  • Supporta nativamente il function calling; insieme alla modalità di output vincolato implementata su la Plateforme, consente lo sviluppo di applicazioni e la modernizzazione degli stack tecnologici su larga scala

  • La sua context window da 64K token consente un richiamo preciso delle informazioni da documenti di grandi dimensioni

Veramente open

Crediamo nel potere dell’apertura e di un’ampia distribuzione per promuovere innovazione e collaborazione nell’AI.

Pertanto, rilasciamo Mixtral 8x22B sotto Apache 2.0, la licenza open source più permissiva, che consente a chiunque di utilizzare il modello ovunque e senza restrizioni.

Efficienza ai massimi livelli

Costruiamo modelli che offrono un’efficienza di costo senza pari per le rispettive dimensioni, garantendo il miglior rapporto prestazioni-costo tra i modelli forniti dalla community.

Mixtral 8x22B è la naturale prosecuzione della nostra famiglia di modelli open. I suoi pattern di attivazione sparse lo rendono più veloce di qualsiasi modello dense 70B, pur essendo più capace di qualsiasi altro modello open-weight (distribuito con licenze permissive o restrittive). La disponibilità del modello base lo rende un’eccellente base per casi d’uso di fine-tuning.

MMLU of Mixtral 8x22b

Figura 1: Misura del compromesso tra prestazioni (MMLU) e budget di inferenza (numero di parametri attivi). Mistral 7B, Mixtral 8x7B e Mixtral 8x22B appartengono tutti a una famiglia di modelli altamente efficienti rispetto agli altri modelli open.

Prestazioni open senza pari

Di seguito è riportato un confronto tra modelli open su benchmark standard di settore.

Ragionamento e conoscenza

Mixtral 8x22B è ottimizzato per il ragionamento.

MMLU of Mixtral 8x22b

Figura 2: Prestazioni sui benchmark diffusi di common sense, ragionamento e conoscenza dei principali modelli LLM open: MMLU (Measuring massive multitask language in understanding), HellaSwag (10-shot), Wino Grande (5-shot), Arc Challenge (5-shot), Arc Challenge (25-shot), TriviaQA (5-shot) e NaturalQS (5-shot).

Capacità multilingue

Mixtral 8x22B dispone di capacità multilingue native. Supera nettamente LLaMA 2 70B nei benchmark HellaSwag, Arc Challenge e MMLU in francese, tedesco, spagnolo e italiano.

MMLU of Mixtral 8x22b

Figura 3: Confronto tra i modelli open source di Mistral e LLaMA 2 70B su HellaSwag, Arc Challenge e MMLU in francese, tedesco, spagnolo e italiano.

Matematica e coding

Mixtral 8x22B offre le migliori prestazioni nei task di coding e matematica rispetto agli altri modelli open.

MMLU of Mixtral 8x22b

Figura 4: Prestazioni sui benchmark più diffusi di coding e matematica dei principali modelli open: HumanEval pass@1, MBPP pass@1, GSM8K maj@1 (5 shot), GSM8K maj@8 (8-shot) e Math maj@4.

La versione instructed di Mixtral 8x22B rilasciata oggi mostra prestazioni matematiche ancora migliori, con un punteggio del 90,8% su GSM8K maj@8 e un punteggio Math maj@4 del 44,6%.

Scopra subito Mixtral 8x22B su la Plateforme e si unisca alla community di developer Mistral mentre definiamo insieme l’avanguardia dell’AI.