Soluzioni

Grande abbastanza

July 24, 2024

By Mistral AI team

Mistral Large

Quest’ultima generazione continua a spingere oltre i limiti dell’efficienza dei costi, della velocità e delle prestazioni. Mistral Large 2 è disponibile su la Plateforme ed è arricchito con nuove funzionalità per facilitare la creazione di applicazioni AI innovative.

Mistral Large 2

Mistral Large 2 ha una finestra di contesto da 128k e supporta decine di lingue, tra cui francese, tedesco, spagnolo, italiano, portoghese, arabo, hindi, russo, cinese, giapponese e coreano, oltre a più di 80 linguaggi di programmazione, tra cui Python, Java, C, C++, JavaScript e Bash.

Mistral Large 2 è progettato per l’inferenza single-node tenendo conto delle applicazioni a contesto lungo: le sue dimensioni di 123 miliardi di parametri gli consentono di funzionare con throughput elevato su un singolo nodo. Rilasciamo Mistral Large 2 con la Mistral Research License, che consente l’uso e la modifica per finalità di ricerca e non commerciali. Per l’uso commerciale di Mistral Large 2 che richiede self-deployment, è necessario acquisire una Mistral Commercial License contattandoci.

Prestazioni generali

Mistral Large 2 stabilisce un nuovo riferimento in termini di prestazioni / costo del serving sulle metriche di valutazione. In particolare, su MMLU, la versione preaddestrata raggiunge un’accuratezza dell’84,0% e definisce un nuovo punto sulla frontiera di Pareto prestazioni/costo dei modelli open.

Codice e ragionamento

Sulla base della nostra esperienza con Codestral 22B e Codestral Mamba, abbiamo addestrato Mistral Large 2 su una percentuale molto elevata di codice. Mistral Large 2 supera ampiamente il precedente Mistral Large e raggiunge prestazioni in linea con modelli leader come GPT-4o, Claude 3 Opus e Llama 3 405B.

Detailed benchmarks

Abbiamo dedicato uno sforzo significativo anche al miglioramento delle capacità di ragionamento del modello. Una delle aree chiave su cui ci siamo concentrati durante l’addestramento è stata ridurre al minimo la tendenza del modello ad “allucinare” o a generare informazioni plausibili nella forma ma fattualmente errate o irrilevanti. Questo risultato è stato ottenuto tramite fine-tuning del modello per renderlo più cauto e selettivo nelle risposte, assicurando output affidabili e accurati.

Inoltre, il nuovo Mistral Large 2 è addestrato a riconoscere quando non riesce a trovare soluzioni o non dispone di informazioni sufficienti per fornire una risposta sicura. Questo impegno per l’accuratezza si riflette nelle prestazioni migliorate del modello su benchmark matematici popolari, a dimostrazione delle sue skill potenziate di ragionamento e problem-solving:

Detailed benchmarks

Accuratezza delle prestazioni sui benchmark di generazione di codice (tutti i modelli sono stati sottoposti a benchmark tramite la stessa pipeline di valutazione)

Detailed benchmarks

Accuratezza delle prestazioni su MultiPL-E (tutti i modelli sono stati sottoposti a benchmark tramite la stessa pipeline di valutazione, ad eccezione della riga “paper”)

Detailed benchmarks

Accuratezza delle prestazioni sui benchmark di generazione GSM8K (8-shot) e MATH (0-shot, senza CoT) (tutti i modelli sono stati sottoposti a benchmark tramite la stessa pipeline di valutazione)

Esecuzione delle istruzioni e allineamento

Abbiamo migliorato drasticamente le capacità conversazionali e di instruction-following di Mistral Large 2. Il nuovo Mistral Large 2 è particolarmente più efficace nel seguire istruzioni precise e nel gestire conversazioni lunghe multi-turn. Di seguito riportiamo le prestazioni sui benchmark MT-Bench, Wild Bench e Arena Hard:

Detailed benchmarks

Prestazioni sui benchmark generali di allineamento (tutti i modelli sono stati sottoposti a benchmark tramite la stessa pipeline di valutazione)

In alcuni benchmark, generare risposte lunghe tende a migliorare i punteggi. Tuttavia, in molte applicazioni aziendali, la concisione è fondamentale: generazioni brevi del modello facilitano interazioni più rapide e rendono l’inferenza più conveniente. Per questo abbiamo dedicato molto impegno a garantire che le generazioni restino sintetiche e pertinenti ogni volta che è possibile. Il grafico seguente riporta la lunghezza media delle generazioni di diversi modelli sulle domande del benchmark MT Bench:

MT Bench benchmarks

Diversità linguistica

Una quota significativa dei casi d’uso aziendali oggi implica lavorare con documenti multilingue. Sebbene la maggior parte dei modelli sia incentrata sull’inglese, il nuovo Mistral Large 2 è stato addestrato su una grande percentuale di dati multilingue. In particolare, eccelle in inglese, francese, tedesco, spagnolo, italiano, portoghese, olandese, russo, cinese, giapponese, coreano, arabo e hindi. Di seguito sono riportati i risultati delle prestazioni di Mistral Large 2 sul benchmark MMLU multilingue, confrontati con il precedente Mistral Large, i modelli Llama 3.1 e Command R+ di Cohere.

Detailed benchmarks

Detailed benchmarks

Prestazioni su MMLU multilingue (misurate sul modello base preaddestrato)

Uso degli strumenti e function calling

Mistral Large 2 è dotato di capacità potenziate di function calling e skill di retrieval ed è stato addestrato per eseguire in modo efficace chiamate di funzione sia parallele sia sequenziali, così da poter fungere da motore portante di applicazioni aziendali complesse.

Detailed benchmarks

Provi Mistral Large 2 su la Plateforme

Può usare Mistral Large 2 già oggi tramite la Plateforme con il nome mistral-large-2407 e testarlo su Le Chat. È disponibile nella versione 24.07 (un sistema di versioning YY.MM che applichiamo a tutti i nostri modelli) e con il nome API mistral-large-2407. I pesi del modello instruct sono disponibili e sono anche ospitati su HuggingFace.

Stiamo consolidando l’offerta su la Plateforme attorno a due modelli general purpose, Mistral Nemo e Mistral Large, e a due modelli specialistici, Codestral ed Embed. Man mano che deprechiamo progressivamente i modelli più datati su la Plateforme, tutti i modelli Apache (Mistral 7B, Mixtral 8x7B e 8x22B, Codestral Mamba, Mathstral) restano disponibili per il deployment e il fine-tuning tramite i nostri SDK mistral-inference e mistral-finetune.

Da oggi estendiamo le capacità di fine-tuning su la Plateforme: sono ora disponibili per Mistral Large, Mistral Nemo e Codestral.

Acceda ai modelli Mistral tramite provider di servizi cloud

Siamo orgogliosi di collaborare con provider di servizi cloud leader per portare il nuovo Mistral Large 2 a un pubblico globale. In particolare, oggi ampliamo la nostra partnership con Google Cloud Platform per rendere disponibili i modelli di Mistral AI su Vertex AI tramite una Managed API. I migliori modelli di Mistral AI sono ora disponibili su Vertex AI, oltre che su Azure AI Studio, Amazon Bedrock e IBM watsonx.ai.

Calendario di disponibilità dei modelli Mistral AI

Detailed benchmarks