Soluzioni

Mistral Small 3

January 30, 2025

By Mistral AI Team

Oggi presentiamo Mistral Small 3, un modello da 24B parametri ottimizzato per la latenza e rilasciato con licenza Apache 2.0.

Up and to the Left

Mistral Small 3 è competitivo con modelli più grandi come Llama 3.3 70B o Qwen 32B, ed è un eccellente sostituto open source di modelli proprietari opachi come GPT4o-mini. Mistral Small 3 è alla pari con Llama 3.3 70B instruct, pur essendo oltre 3 volte più veloce sullo stesso hardware.

Mistral Small 3 è un modello preaddestrato e istruito, pensato per l’“80%” delle attività di IA generativa: quelle che richiedono solide prestazioni linguistiche e di instruction following, con una latenza molto bassa.

Abbiamo progettato questo nuovo modello per massimizzare le prestazioni a una dimensione adatta al deployment locale. In particolare, Mistral Small 3 ha molti meno layer rispetto ai modelli concorrenti, riducendo in modo sostanziale il tempo per forward pass. Con oltre l’81% di accuratezza su MMLU e una latenza di 150 token/s, Mistral Small è attualmente il modello più efficiente della sua categoria.

Rilasciamo sia un checkpoint preaddestrato sia uno instruction-tuned con licenza Apache 2.0. I checkpoint possono fungere da base potente per accelerare i progressi. Si noti che Mistral Small 3 non è addestrato né con RL né con dati sintetici, quindi si trova in una fase più iniziale della pipeline di produzione dei modelli rispetto a modelli come Deepseek R1 (una tecnologia open source eccellente e complementare). Può fungere da ottimo modello base per costruire capacità di ragionamento incrementali. Non vediamo l’ora di scoprire come la community open source lo adotterà e lo personalizzerà.

Prestazioni

Valutazioni umane

 

Mistral Small 3 Human Evals

Abbiamo condotto valutazioni side-by-side con un fornitore terzo esterno, su un set di oltre 1k prompt proprietari di coding e generalisti. Ai valutatori è stato chiesto di selezionare la risposta del modello preferita tra generazioni anonimizzate prodotte da Mistral Small 3 rispetto a un altro modello. Siamo consapevoli che in alcuni casi i benchmark basati sul giudizio umano differiscono nettamente dai benchmark disponibili pubblicamente, ma abbiamo adottato ulteriori cautele per verificare l’equità della valutazione. Siamo certi che i benchmark sopra riportati siano validi.

Prestazioni instruct

Il nostro modello instruction-tuned offre prestazioni competitive rispetto a modelli open weight tre volte più grandi e al modello proprietario GPT4o-mini nei benchmark di Code, Math, conoscenza generale e instruction following.

Mistral Instruct Knowledge

 

Mistral Instruct Code Math

 

Mistral Instruct If

L’accuratezza delle prestazioni su tutti i benchmark è stata ottenuta tramite la stessa pipeline di valutazione interna; pertanto, i valori possono variare leggermente rispetto alle prestazioni riportate in precedenza (Qwen2.5-32B-InstructLlama-3.3-70B-InstructGemma-2-27B-IT). Le valutazioni basate su giudice, come Wildbench, Arena hard e MTBench, si sono basate su gpt-4o-2024-05-13.

Prestazioni di pretraining

Mistral Base Benchmarks

 

Mistral Base Mmlu Int

Mistral Small 3, un modello 24B, offre le migliori prestazioni nella sua classe dimensionale e compete con modelli tre volte più grandi, come Llama 3.3 70B.

Quando usare Mistral Small 3

Tra i nostri clienti e nella community, vediamo emergere diversi casi d’uso distinti per modelli preaddestrati di queste dimensioni:

  • Assistenza conversazionale a risposta rapida: Mistral Small 3 eccelle negli scenari in cui risposte rapide e accurate sono fondamentali. Ciò include assistenti virtuali in molti scenari in cui gli utenti si aspettano feedback immediato e interazioni quasi in tempo reale.

  • Function calling a bassa latenza: Mistral Small 3 è in grado di gestire l’esecuzione rapida di funzioni quando viene usato nell’ambito di workflow automatizzati o agentici.

  • Fine-tuning per creare esperti di dominio: Mistral Small 3 può essere sottoposto a fine-tuning per specializzarsi in domini specifici, creando esperti di dominio altamente accurati. Questo è particolarmente utile in ambiti come consulenza legale, diagnostica medica e supporto tecnico, dove la conoscenza specifica del dominio è essenziale.

  • Inferenza locale: particolarmente vantaggiosa per hobbisti e organizzazioni che gestiscono informazioni sensibili o proprietarie. Una volta quantizzato, Mistral Small 3 può essere eseguito privatamente su una singola RTX 4090 o su un Macbook con 32GB di RAM.

I nostri clienti stanno valutando Mistral Small 3 in diversi settori, tra cui:

  • Clienti dei servizi finanziari per il rilevamento delle frodi

  • Provider sanitari per il triage dei clienti

  • Aziende di robotica, automotive e manifatturiere per comando e controllo on-device

  • I casi d’uso trasversali tra i clienti includono customer service virtuale e analisi di sentiment e feedback.

Usare Mistral Small 3 sullo stack tecnologico preferito

Mistral Small 3 è ora disponibile su la Plateforme come mistral-small-latest o mistral-small-2501. Consulti la nostra documentazione per scoprire come usare i nostri modelli per la generazione di testo.

Siamo inoltre lieti di collaborare con Hugging Face, Ollama, Kaggle, Together AI e Fireworks AI per rendere il modello disponibile sulle loro piattaforme a partire da oggi:

La strada da percorrere

Sono stati giorni entusiasmanti per la community open source. Mistral Small 3 completa i grandi modelli open source di ragionamento, come le recenti release di DeepSeek, e può fungere da solido modello base per far emergere capacità di ragionamento.

Tra molte altre novità, nelle prossime settimane arriveranno modelli Mistral piccoli e grandi con capacità di ragionamento potenziate. Si unisca al percorso se è interessato (stiamo assumendo), oppure ci anticipi lavorando su Mistral Small 3 già oggi e rendendolo migliore.

Modelli open source in Mistral

Rinnoviamo il nostro impegno a utilizzare la licenza Apache 2.0 per i nostri modelli general purpose, mentre ci allontaniamo progressivamente dai modelli con licenza MRL. Come per Mistral Small 3, i pesi dei modelli saranno disponibili per il download e il deployment locale, e potranno essere modificati e utilizzati liberamente per qualsiasi scopo. Questi modelli saranno inoltre resi disponibili tramite una serverless API su la Plateforme, attraverso i nostri deployment on-prem e VPC, la piattaforma di personalizzazione e orchestrazione, e tramite i nostri partner di inferenza e cloud. Aziende e sviluppatori che necessitano di capacità specializzate (maggiore velocità e contesto, conoscenza specifica di dominio, modelli task-specific come code completion) potranno contare su ulteriori modelli commerciali a complemento di ciò che contribuiamo alla community.