Prodotto

Portare i modelli di IA aperti allo stato dell'arte

September 27, 2023

By Mistral AI team

L'IA generativa, in particolare i modelli linguistici di grandi dimensioni, sta rivoluzionando la creazione di contenuti, il recupero della conoscenza e la risoluzione dei problemi generando testi, contenuti e comandi di qualità umana sulla base di istruzioni umane. Nei prossimi anni, l'IA generativa ridefinirà completamente la nostra cultura e le nostre vite, il modo in cui interagiamo con le macchine e con i nostri simili.

Come nelle precedenti epoche del software, le soluzioni proprietarie sono state sviluppate per prime, e siamo grati che abbiano rivelato al mondo la potenza dei modelli generativi. Tuttavia, come per il Web, per i browser web (Webkit), per i sistemi operativi (Linux), per l'orchestrazione cloud (Kubernetes), le soluzioni aperte supereranno rapidamente quelle proprietarie nella maggior parte dei casi d'uso. Saranno spinte dalla forza della community e dall'esigenza di eccellenza tecnica che i progetti open-source di successo hanno sempre promosso.

In Mistral AI, crediamo che un approccio aperto all'IA generativa sia necessario. Lo sviluppo di modelli sostenuto dalla community è la via più sicura per contrastare censura e bias in una tecnologia che plasma il nostro futuro.

Crediamo fermamente che, addestrando i nostri modelli, rilasciandoli apertamente e promuovendo i contributi della community, possiamo costruire un'alternativa credibile all'oligopolio emergente dell'IA. I modelli generativi a pesi aperti svolgeranno un ruolo cruciale nella prossima rivoluzione dell'IA.

La missione di Mistral AI è guidare la rivoluzione dei modelli aperti.

L'IA generativa ha bisogno di modelli aperti

Lavorare con modelli aperti è il modo migliore, sia per i fornitori sia per gli utenti, di costruire un business sostenibile attorno alle soluzioni di IA. I modelli aperti possono essere adattati finemente per risolvere molti nuovi problemi business-critical, in tutti i verticali di settore, in modi che i modelli black-box non possono eguagliare. Il futuro sarà composto da molti modelli specializzati diversi, ciascuno adattato a compiti specifici, compresso il più possibile e connesso a modalità specifiche.

Nel paradigma dei modelli aperti, chi sviluppa ha pieno controllo sul motore che alimenta la propria applicazione. Dimensioni e costi dei modelli possono essere adattati alla difficoltà specifica del compito, per mantenere sotto controllo costi e latenza. Per le aziende, distribuire modelli aperti sulla propria infrastruttura usando soluzioni ben pacchettizzate semplifica le dipendenze e tutela la privacy dei dati.

Le API chiuse e opache introducono responsabilità tecniche ben note, in particolare rischi di fuga di proprietà intellettuale; nel caso dell'IA generativa, introducono anche una responsabilità culturale, poiché il contenuto generato è interamente sotto il controllo del provider dell'API, con capacità di personalizzazione limitate. Avendo a disposizione i pesi del modello, chi sviluppa applicazioni per utenti finali può personalizzare i guardrail e il tono editoriale desiderati, invece di dipendere dalle scelte e dai bias dei provider di modelli black-box.

I modelli aperti saranno anche preziose salvaguardie contro l'uso improprio dell'IA generativa. Permetteranno a istituzioni pubbliche e aziende private di sottoporre i sistemi generativi ad audit per individuarne le criticità e rilevare utilizzi scorretti dei modelli generativi. Sono la nostra scommessa più forte per rilevare efficacemente contenuti di disinformazione, la cui quantità aumenterà inevitabilmente nei prossimi anni.

I primi passi di Mistral AI

La nostra ambizione è diventare il principale sostenitore della community dell'IA generativa aperta e portare i modelli aperti a prestazioni allo stato dell'arte. Li renderemo le soluzioni di riferimento per la maggior parte delle applicazioni di IA generativa. Molti di noi hanno avuto ruoli cruciali in passaggi importanti dello sviluppo degli LLM; siamo entusiasti di lavorare insieme su nuovi modelli all'avanguardia con una mentalità orientata alla community.

Nei prossimi mesi, Mistral AI rilascerà progressivamente e metodicamente nuovi modelli che colmeranno il divario di prestazioni tra soluzioni black-box e aperte, rendendo le soluzioni aperte le migliori opzioni per una gamma crescente di casi d'uso enterprise. Parallelamente, cercheremo di sostenere gli sforzi della community per migliorare le prossime generazioni di modelli.

Nell'ambito di questo impegno, rilasciamo oggi [Mistral 7B]( {{< ref "news/announcing-mistral-7b" >}} ), il nostro primo modello da 7B parametri, che supera tutti i modelli aperti attualmente disponibili fino a 13B parametri in tutti i benchmark standard in inglese e di codice. È il risultato di tre mesi di lavoro intenso, durante i quali abbiamo assemblato il team di Mistral AI, ricostruito da zero uno stack MLops ad altissime prestazioni e progettato una pipeline di elaborazione dei dati estremamente sofisticata.

Le prestazioni di Mistral 7B dimostrano cosa possono fare i modelli piccoli con sufficiente determinazione. Monitorare i modelli più piccoli che superano il 60% su MMLU è piuttosto istruttivo: in due anni si è passati da Gopher (280B, DeepMind. 2021), a Chinchilla (70B, DeepMind, 2022), a Llama 2 (34B, Meta, luglio 2023) e a Mistral 7B.

Mistral 7B è solo un primo passo verso la costruzione dei modelli all'avanguardia nella nostra roadmap. Tuttavia, può essere utilizzato per risolvere molti compiti: riepilogo, strutturazione e question answering, per citarne alcuni. Elabora e genera testo molto più rapidamente delle grandi soluzioni proprietarie e opera a una frazione dei loro costi.

Mistral 7B è rilasciato con licenza Apache 2.0, il che lo rende utilizzabile senza restrizioni ovunque.

Cosa viene dopo?

Per interagire attivamente con la nostra community di utenti e promuovere un uso responsabile dei modelli e degli strumenti che rilasciamo con licenze open-source, stiamo aprendo un repository GitHub e un canale Discord. Offriranno una piattaforma per collaborazione, supporto e comunicazione trasparente.

Ci impegniamo a rilasciare i modelli aperti più potenti parallelamente allo sviluppo della nostra offerta commerciale. Proporremo modelli proprietari ottimizzati per deployment on-premise/virtual private cloud. Questi modelli saranno distribuiti come soluzioni white-box, rendendo disponibili sia i pesi sia il codice sorgente. Stiamo lavorando attivamente a soluzioni hosted e deployment dedicati per le aziende.

Stiamo già addestrando modelli molto più grandi e ci stiamo orientando verso architetture innovative. Restate in contatto per i prossimi rilasci di questo autunno.