DSO (black)

Costruire un’AI sovrana per la difesa: come DSO ha realizzato un modello mixture-of-experts (MoE) personalizzato.

DSO National Laboratories ha collaborato con Mistral per costruire un large language model (LLM) personalizzato utilizzando Forge, il sistema di addestramento end-to-end di Mistral.

DSO National Laboratories e Mistral

Punti chiave:

  • Sviluppo accelerato di modelli multilingue mixture-of-experts (MoE)

  • Basato su Forge, il sistema end-to-end di Mistral per l’addestramento di modelli personalizzati all’avanguardia

"Collaborare con Mistral ci ha dato accesso diretto a competenze nell’architettura MoE, aiutandoci ad accelerare la roadmap di sviluppo dei nostri modelli." — Dr Hai Leong Chieu, Distinguished Member of Technical Staff, DSO National Laboratories (DSO)

DSO National Laboratories è la più grande organizzazione di R&D per la difesa di Singapore, con oltre 1.800 ingegneri e scienziati impegnati nello sviluppo di capacità per la sicurezza nazionale di Singapore. Con l’AI sempre più centrale nelle operazioni di difesa e requisiti di missione sempre più complessi, DSO doveva addestrare da zero i propri large language model multilingue, da distribuire interamente on-premise. Per accelerare lo sviluppo, DSO ha collaborato con Mistral per co-sviluppare un modello MoE multilingue specializzato utilizzando Forge, il sistema end-to-end di Mistral per lo sviluppo e l’addestramento di modelli personalizzati all’avanguardia.

Il caso dell’AI autosufficiente.

L’apparato di difesa di Singapore opera in un contesto sempre più complesso, in cui i team devono analizzare grandi volumi di dati sotto forte pressione temporale. Per il Dr. Chieu, che guida la ricerca su Natural Language Processing e LLM presso la Information Division di DSO, la missione era costruire un’AI autosufficiente, in grado di operare indipendentemente da qualsiasi fornitore esterno o interruzione della supply chain.

“La nostra strategia è sempre stata sviluppare la capacità di addestrare i nostri large language model da zero,” ha spiegato il Dr. Chieu. "Vogliamo essere nella posizione di fornire ai nostri clienti soluzioni AI on-prem performanti."

Il team di DSO pre-addestrava da anni i propri modelli e seguiva la ricerca open source. Le basi erano solide, ma padroneggiare l’architettura MoE, che DSO aveva identificato come cruciale per la prossima generazione di LLM, richiedeva un’esperienza pratica e su larga scala che il team non aveva ancora maturato.

Perché Mistral e perché MoE.

DSO ha scelto Mistral per il suo track record. Mistral aveva già costruito e distribuito modelli MoE in produzione, su larga scala, offrendo a DSO accesso diretto all’esperienza rilevante per questo progetto.

"Abbiamo capito presto che l’architettura MoE era la direzione in cui si stava muovendo il settore,” ha ricordato il Dr. Chieu. “Mistral aveva già dimostrato il successo concreto di questa architettura, e quel track record era esattamente ciò di cui avevamo bisogno in un partner."

I due team hanno co-sviluppato un modello MoE utilizzando lo stack di sviluppo modelli di Mistral, successivamente integrato in Forge. I dati di addestramento includevano contenuti linguistici ottenuti tramite AI Singapore (AISG). Entrambi i team hanno lavorato in un ambiente di sviluppo condiviso, che ha favorito iterazioni e feedback più rapidi.

Più della configurazione tecnica, il Dr. Chieu ha apprezzato il trasferimento di conoscenze. "Il ritmo della ricerca in questo settore fa sì che ciò che viene pubblicato sia spesso in ritardo rispetto a ciò che funziona davvero nella pratica," ha dichiarato. "Collaborare con Mistral ci ha dato un accesso diretto a quella conoscenza, aiutandoci a concentrarci su approcci comprovati che producono risultati."

Dall’addestramento di modelli personalizzati all’edge AI.

Il modello MoE personalizzato ha raggiunto prestazioni di riferimento nella sua classe sui benchmark delle lingue del Sud-est asiatico, soddisfacendo la soglia prestazionale per i casi d’uso operativi di DSO. Oltre ai numeri, la collaborazione ha fatto avanzare le capacità interne di DSO, sia per ciò che il team ha costruito sia per ciò che ora può costruire in autonomia.

Partendo da queste basi, DSO e Mistral hanno poi avviato una seconda fase di lavoro. "La nostra prossima sfida è costruire modelli di ragionamento piccoli e ad alte prestazioni, capaci di operare in modo efficiente all’edge su sistemi autonomi impiegati sul campo,” ha affermato il Dr. Chieu. “È un obiettivo ambizioso, che siamo certi di poter perseguire insieme a Mistral."

Il lavoro riflette una traiettoria più ampia: dalla creazione di capacità fondamentali per l’addestramento di LLM allo sviluppo di AI per ambienti esigenti e con risorse limitate.