Mistral AI porta agli sviluppatori i più potenti modelli generativi open, insieme a modalità efficienti per distribuirli e personalizzarli per la produzione.
Oggi apriamo l’accesso Beta ai nostri primi servizi di piattaforma. Partiamo in modo semplice: La Plateforme offre tre endpoint di chat per generare testo seguendo istruzioni testuali e un endpoint di embedding. Ogni endpoint presenta un diverso compromesso tra prestazioni e prezzo.
Endpoint generativi
I primi due endpoint, mistral-tiny e mistral-small, utilizzano attualmente i nostri due modelli open rilasciati; il terzo, mistral-medium, utilizza un modello prototipo con prestazioni superiori che stiamo testando in un contesto distribuito.
Serviamo versioni instruction-tuned dei nostri modelli. Abbiamo lavorato per consolidare le tecniche di alignment più efficaci (fine-tuning efficiente, ottimizzazione diretta delle preferenze) per creare modelli facili da controllare e piacevoli da usare. Pre-addestriamo i modelli su dati estratti dal Web aperto ed eseguiamo l’instruction fine-tuning a partire da annotazioni.
Mistral-tiny. Il nostro endpoint più conveniente serve attualmente Mistral 7B Instruct v0.2, una nuova release minore di Mistral 7B Instruct. Mistral-tiny funziona solo in inglese. Ottiene 7,6 su MT-Bench. Il modello instruction-tuned può essere scaricato qui.
Mistral-small. Questo endpoint serve attualmente il nostro modello più recente, Mixtral 8x7B, descritto in maggiore dettaglio nel nostro post del blog. Padroneggia inglese/francese/italiano/tedesco/spagnolo e il codice, e ottiene 8,3 su MT-Bench.
Mistral-medium. Il nostro endpoint di qualità più elevata serve attualmente un modello prototipo, che oggi rientra tra i migliori modelli serviti disponibili in base ai benchmark standard. Padroneggia inglese/francese/italiano/tedesco/spagnolo e il codice, e ottiene un punteggio di 8,6 su MT-Bench. La tabella seguente confronta le prestazioni dei modelli di base di Mistral-medium, Mistral-small e dell’endpoint di un concorrente.

Endpoint di embedding
Mistral-embed, il nostro endpoint di embedding, serve un modello di embedding con una dimensione di embedding pari a 1024. Il nostro modello di embedding è stato progettato pensando alle capacità di retrieval. Raggiunge un punteggio di retrieval di 55,26 su MTEB.
Specifiche API
La nostra API segue le specifiche della popolare interfaccia di chat proposta inizialmente dal nostro più caro concorrente. Forniamo una libreria client Python e Javascript per interrogare i nostri endpoint. I nostri endpoint consentono agli utenti di fornire un system prompt per impostare un livello più elevato di moderazione sugli output del modello per le applicazioni in cui questo è un requisito importante.
Dal Beta access alla disponibilità generale
Da oggi chiunque può registrarsi per utilizzare la nostra API, mentre aumentiamo progressivamente la nostra capacità. Il nostro team commerciale può aiutare a qualificare le Sue esigenze e ad accelerare l’accesso. Ci aspettiamo qualche imperfezione mentre stabilizziamo la nostra piattaforma in vista di una disponibilità pienamente self-service.
Ringraziamenti
Siamo grati a NVIDIA per averci supportato nell’integrazione di TensorRT-LLM e Triton e per aver collaborato con noi per rendere una Mixture of Experts sparsa compatibile con TRT-LLM.




