La sicurezza svolge un ruolo fondamentale nel rendere utile l'AI. In Mistral AI, riteniamo che i guardrail a livello di sistema siano essenziali per proteggere i deployment downstream. Per questo rilasciamo una nuova API di moderazione dei contenuti. È la stessa API che alimenta il servizio di moderazione in Le Chat. La lanciamo per consentire ai nostri utenti di utilizzare e adattare questo strumento alle loro applicazioni e ai loro standard di sicurezza specifici.
Negli ultimi mesi abbiamo osservato un crescente interesse, sia nel settore sia nella comunità di ricerca, per i nuovi sistemi di moderazione basati su LLM, che possono contribuire a rendere la moderazione più scalabile e robusta tra le diverse applicazioni. Il nostro modello è un classificatore LLM addestrato a classificare gli input testuali nelle 9 categorie definite di seguito. Rilasciamo due endpoint: uno per il testo grezzo e uno per i contenuti conversazionali. I contenuti indesiderati dipendono in modo molto specifico dal contesto; pertanto, abbiamo addestrato il nostro modello a classificare l'ultimo messaggio di una conversazione all'interno di un contesto conversazionale. Consulti la nostra documentazione tecnica per maggiori informazioni. Il modello è nativamente multilingue ed è stato addestrato in particolare su arabo, cinese, inglese, francese, tedesco, italiano, giapponese, coreano, portoghese, russo e spagnolo.

Il classificatore di moderazione dei contenuti sfrutta le categorie di policy più rilevanti per guardrail efficaci e introduce un approccio pragmatico alla sicurezza degli LLM, affrontando i danni generati dai modelli, come consulenze non qualificate e PII. L'insieme completo delle definizioni delle policy e i dettagli su come iniziare sono disponibili nella nostra documentazione tecnica.
Prestazioni
Di seguito condividiamo l'AUC PR sulle diverse policy, misurata sul nostro set di test interno.

Collaboriamo con i nostri clienti per creare e condividere strumenti di moderazione scalabili, leggeri e personalizzabili, e continueremo a confrontarci con la comunità di ricerca per contribuire ai progressi della sicurezza nel settore più ampio.




