Soluzioni

Mixtral degli esperti

December 11, 2023

By Mistral AI team

Mistral AI prosegue la sua missione: offrire i migliori modelli aperti alla community degli sviluppatori. Far progredire l’AI richiede nuove svolte tecnologiche, oltre il riutilizzo di architetture e paradigmi di training già noti. Soprattutto, richiede di mettere a disposizione della community modelli originali per favorire nuove invenzioni e nuovi usi.

Oggi il team è orgoglioso di rilasciare Mixtral 8x7B, un modello sparse mixture of experts (SMoE) di alta qualità con pesi aperti. Con licenza Apache 2.0. Mixtral supera Llama 2 70B nella maggior parte dei benchmark con un’inferenza 6 volte più rapida. È il modello a pesi aperti più potente con licenza permissiva e il miglior modello in assoluto per rapporto costo/prestazioni. In particolare, eguaglia o supera GPT3.5 nella maggior parte dei benchmark standard.

Mixtral offre le seguenti capacità.

  • Gestisce in modo efficiente un contesto di 32k token.

  • Gestisce inglese, francese, italiano, tedesco e spagnolo.

  • Dimostra prestazioni elevate nella generazione di codice.

  • Può essere sottoposto a finetuning per diventare un modello in grado di seguire istruzioni, raggiungendo un punteggio di 8,3 su MT-Bench.

Spingere oltre lo stato dell’arte dei modelli aperti con architetture sparse

Mixtral è una rete sparse mixture-of-experts. È un modello decoder-only in cui il blocco feedforward seleziona da un insieme di 8 gruppi distinti di parametri. A ogni layer, per ogni token, una rete router sceglie due di questi gruppi (gli “esperti”) per elaborare il token e combinarne l’output in modo additivo.

Questa tecnica aumenta il numero di parametri di un modello mantenendo sotto controllo costi e latenza, poiché il modello utilizza solo una frazione dell’insieme totale di parametri per token. In concreto, Mixtral ha 46,7B parametri totali, ma utilizza solo 12,9B parametri per token. Di conseguenza, elabora input e genera output alla stessa velocità e allo stesso costo di un modello da 12,9B.

Mixtral è pre-addestrato su dati estratti dal Web aperto: addestriamo esperti e router simultaneamente.

Prestazioni

Confrontiamo Mixtral con la famiglia Llama 2 e con il modello base GPT3.5. Mixtral eguaglia o supera Llama 2 70B, così come GPT3.5, nella maggior parte dei benchmark.

Performance overview

Nella figura seguente, misuriamo il trade-off tra qualità e budget di inferenza. Mistral 7B e Mixtral 8x7B appartengono a una famiglia di modelli altamente efficienti rispetto ai modelli Llama 2.

Scaling of performances

La tabella seguente riporta i risultati dettagliati relativi alla figura precedente.

Detailed benchmarks

Allucinazioni e bias. Per identificare possibili difetti da correggere tramite fine-tuning / preference modelling, misuriamo le prestazioni del modello base su BBQ/BOLD.

BBQ BOLD benchmarks

Rispetto a Llama 2, Mixtral presenta meno bias nel benchmark BBQ. Nel complesso, Mixtral mostra sentiment più positivi rispetto a Llama 2 su BOLD, con varianze simili all’interno di ciascuna dimensione.

Lingua. Mixtral 8x7B padroneggia francese, tedesco, spagnolo, italiano e inglese.

Multilingual benchmarks

Modelli istruiti

Rilasciamo Mixtral 8x7B Instruct insieme a Mixtral 8x7B. Questo modello è stato ottimizzato tramite supervised fine-tuning e direct preference optimisation (DPO) per seguire le istruzioni con attenzione. Su MT-Bench raggiunge un punteggio di 8,30, diventando il miglior modello open-source, con prestazioni paragonabili a GPT3.5.

Nota: Mixtral può essere guidato con prompt mirati per bloccare alcuni output durante la creazione di applicazioni che richiedono un elevato livello di moderazione, come illustrato qui. Anche un opportuno preference tuning può servire a questo scopo. Tenga presente che, senza un prompt di questo tipo, il modello seguirà semplicemente qualsiasi istruzione fornita.

Distribuire Mixtral con uno stack di deployment open-source

Per consentire alla community di eseguire Mixtral con uno stack completamente open-source, abbiamo inviato modifiche al progetto vLLM, che integra i kernel CUDA di Megablocks per un’inferenza efficiente.

Skypilot consente il deployment di endpoint vLLM su qualsiasi istanza nel cloud.

Utilizzi Mixtral sulla nostra piattaforma.

Attualmente utilizziamo Mixtral 8x7B dietro il nostro endpoint mistral-small, che è disponibile in beta. Si registri per ottenere l’accesso anticipato a tutti gli endpoint generativi e di embedding.

Ringraziamenti

Ringraziamo i team di CoreWeave e Scaleway per il supporto tecnico durante l’addestramento dei nostri modelli.