Dopo la pubblicazione della famiglia Mixtral, Codestral Mamba rappresenta un ulteriore passo nel nostro impegno per studiare e offrire nuove architetture. È disponibile per l'uso, la modifica e la distribuzione gratuiti, e auspichiamo che apra nuove prospettive nella ricerca sulle architetture. Codestral Mamba è stato progettato con il contributo di Albert Gu e Tri Dao.
A differenza dei modelli Transformer, i modelli Mamba offrono il vantaggio dell'inferenza in tempo lineare e la capacità teorica di modellare sequenze di lunghezza infinita. Consentono agli utenti di interagire ampiamente con il modello ottenendo risposte rapide, indipendentemente dalla lunghezza dell'input. Questa efficienza è particolarmente rilevante per i casi d'uso legati alla produttività nel codice: per questo abbiamo addestrato questo modello con capacità avanzate di coding e reasoning, consentendogli di offrire prestazioni alla pari dei modelli SOTA basati su transformer.

Abbiamo testato Codestral Mamba sulle capacità di retrieval in-context fino a 256k token. Ci aspettiamo che diventi un ottimo assistente locale per il codice.
Può distribuire Codestral Mamba utilizzando l'SDK mistral-inference, che si basa sulle implementazioni di riferimento del repository GitHub di Mamba. Il modello può essere distribuito anche tramite TensorRT-LLM. Per l'inferenza locale, tenga d'occhio il supporto in llama.cpp. Può scaricare i pesi raw da HuggingFace. Si tratta di un modello instruction-tuned, con 7.285.403.648 parametri.
Per facilitare i test, abbiamo reso Codestral Mamba disponibile su la Plateforme (codestral-mamba-2407), insieme alla sua sorella maggiore, Codestral 22B. Mentre Codestral Mamba è disponibile con licenza Apache 2.0, Codestral 22B è disponibile con una licenza commerciale per il self-deployment o con una licenza community per finalità di test.




