Soluzioni

Mistral NeMo

July 18, 2024

By Mistral AI team

Oggi siamo lieti di annunciare il rilascio di Mistral NeMo, un modello da 12B sviluppato in collaborazione con NVIDIA. Mistral NeMo offre un'ampia finestra di contesto fino a 128k token. Le sue capacità di ragionamento, la conoscenza del mondo e l'accuratezza nella generazione di codice sono allo stato dell'arte nella sua categoria dimensionale. Poiché si basa su un'architettura standard, Mistral NeMo è facile da usare e può sostituire direttamente Mistral 7B in qualsiasi sistema che lo utilizzi.

Abbiamo rilasciato checkpoint di base pre-addestrati e ottimizzati per le istruzioni con licenza Apache 2.0, per favorirne l'adozione da parte di ricercatori e aziende. Mistral NeMo è stato addestrato con consapevolezza della quantizzazione, consentendo l'inferenza FP8 senza alcuna perdita di prestazioni.

La tabella seguente confronta l'accuratezza del modello base Mistral NeMo con quella di due recenti modelli pre-addestrati open-source, Gemma 2 9B e Llama 3 8B.

Mistral NeMo base model performance compared to Gemma 2 9B and Llama 3 8B

Tabella 1: prestazioni del modello base Mistral NeMo rispetto a Gemma 2 9B e Llama 3 8B.

Modello multilingue per tutti

Il modello è progettato per applicazioni globali e multilingue. È addestrato sul function calling, dispone di un'ampia finestra di contesto ed è particolarmente efficace in inglese, francese, tedesco, spagnolo, italiano, portoghese, cinese, giapponese, coreano, arabo e hindi. Questo rappresenta un nuovo passo verso la disponibilità di modelli di IA all'avanguardia per tutti, in tutte le lingue che costituiscono la cultura umana.

Mistral NeMo performance on multilingual benchmarks

Figura 1: prestazioni di Mistral NeMo sui benchmark multilingue.

Tekken, un tokenizer più efficiente

Mistral NeMo utilizza un nuovo tokenizer, Tekken, basato su Tiktoken, addestrato su oltre 100 lingue, che comprime il testo in linguaggio naturale e il codice sorgente in modo più efficiente rispetto al tokenizer SentencePiece usato nei precedenti modelli Mistral. In particolare, è circa il 30% più efficiente nella compressione del codice sorgente, del cinese, dell'italiano, del francese, del tedesco, dello spagnolo e del russo. È inoltre rispettivamente 2 volte e 3 volte più efficiente nella compressione del coreano e dell'arabo. Rispetto al tokenizer di Llama 3, Tekken si è dimostrato più efficace nella compressione del testo per circa l'85% di tutte le lingue.

Tekken compression rate

Figura 2: tasso di compressione di Tekken.

Fine-tuning delle istruzioni

Mistral NeMo è stato sottoposto a una fase avanzata di fine-tuning e allineamento. Rispetto a Mistral 7B, è molto più efficace nel seguire istruzioni precise, ragionare, gestire conversazioni multi-turno e generare codice.

Mistral NeMo instruction-tuned model accuracy

Tabella 2: accuratezza del modello Mistral NeMo ottimizzato per le istruzioni. Valutazioni eseguite con GPT4o come giudice su riferimenti ufficiali.

Link

I pesi sono ospitati su HuggingFace sia per i modelli base sia per i modelli instruct. È possibile provare subito Mistral NeMo con mistral-inference e adattarlo con mistral-finetune. Mistral NeMo è esposto su la Plateforme con il nome open-mistral-nemo-2407. Questo modello è inoltre distribuito in un container come microservizio di inferenza NVIDIA NIM ed è disponibile da ai.nvidia.com.