Nota: questo modello è deprecato
Pixtral Large non è più mantenuto ed è stato sostituito dai nostri modelli vision e multimodali più recenti e potenti.
Pixtral Large in breve:
Prestazioni multimodali all'avanguardia
Stato dell'arte su MathVista, DocVQA, VQAv2
Estende Mistral Large 2 senza compromettere le prestazioni sul testo
Decoder multimodale da 123B, encoder visivo da 1B di parametri
Finestra di contesto da 128K: contiene almeno 30 immagini ad alta risoluzione
Uso:
Oggi annunciamo Pixtral Large, un modello multimodale open-weights da 124B costruito su Mistral Large 2. Pixtral Large è il secondo modello della nostra famiglia multimodale e dimostra capacità di comprensione delle immagini all'avanguardia. In particolare, il modello è in grado di comprendere documenti, grafici e immagini naturali, mantenendo al tempo stesso la comprensione testuale leader di Mistral Large 2.
Il modello è disponibile con la Mistral Research License (MRL) per uso di ricerca e didattico; e con la Mistral Commercial License per sperimentazione, test e produzione a fini commerciali.

Prestazioni
Valutiamo Pixtral Large rispetto a modelli all'avanguardia su un insieme di benchmark multimodali standard, tramite un harness di test comune. Su MathVista, che valuta il ragionamento matematico complesso su dati visivi, il nostro modello raggiunge il 69,4%, superando tutti gli altri modelli. Per valutare le capacità di ragionamento su grafici e documenti complessi, misuriamo le prestazioni con ChartQA e DocVQA, dove Pixtral Large supera GPT-4o e Gemini-1.5 Pro.
Pixtral Large dimostra inoltre capacità competitive su MM-MT-Bench, superando Claude-3.5 Sonnet (nuovo), Gemini-1.5 Pro e GPT-4o (più recente). MM-MT-Bench è una valutazione open-source basata su giudice, pensata per riflettere casi d'uso reali degli LLM multimodali (veda il report tecnico di Pixtral 12B per i dettagli).

Infine, nella LMSys Vision Leaderboard, Pixtral Large è il miglior modello open-weights con un margine sostanziale, superando il concorrente più vicino di quasi 50 punti ELO. Pixtral Large supera inoltre diversi modelli proprietari, come GPT-4o (agosto '24).

Esempi qualitativi
OCR e ragionamento multilingue...

Prompt:
Ho comprato il caffè e la salsiccia. Quanto devo? Aggiungi una mancia del 18%.
Risposta:
Per calcolare l'importo totale dovuto, inclusa la mancia del 18%, segua questi passaggi:
Calcolare il costo del caffè e della salsiccia:
2x Latte Macchiato: 2 * 4.50 CHF = 9.00 CHF
1x Schweinschnitzel: 22.00 CHF
Costo totale per caffè e salsiccia: 9.00 CHF + 22.00 CHF = 31.00 CHF
Calcolare la mancia del 18%:
Mancia: 31.00 CHF * 0.18 = 5.58 CHF
Aggiungere la mancia al costo totale:
Importo totale dovuto: 31.00 CHF + 5.58 CHF = 36.58 CHF
Quindi, il totale dovuto è 36.58 CHF.
Comprensione dei grafici...

Prompt:
Quando hanno iniziato ad andare male le cose per dark dragon?
Risposta:
La perdita di training per il modello "dark-dragon-50" inizia a mostrare un'instabilità significativa intorno alla soglia dei 10.000 step. In questo punto si osserva un picco evidente nel valore della loss, e l'instabilità continua con un altro picco importante intorno alla soglia dei 20.000 step. Questi picchi indicano che il processo di training del modello "dark-dragon-50" ha iniziato a incontrare problemi a partire da circa 10.000 step.
E altro ancora...

Prompt:
Quali aziende usano modelli realizzati da Mistral AI?
Risposta:
Le aziende che usano modelli realizzati da Mistral AI, come mostrato nell'immagine, sono:
BNP Paribas
Brave
Cloudflare
CMA CGM
Front
Un'ultima cosa...
Insieme a Pixtral Large, anche Mistral Large, il nostro modello testuale allo stato dell'arte, riceve un aggiornamento. Il modello è disponibile come pixtral-large-latest sulla nostra API, nonché per il self-deployment come Mistral Large 24.11 su HuggingFace con la Mistral Research License (MRL) per la ricerca, oppure con una licenza commerciale di Mistral AI per uso commerciale.
Questo modello più recente offre un aggiornamento significativo rispetto al precedente Mistral Large 24.07, con miglioramenti notevoli nella comprensione di contesti lunghi, un nuovo system prompt e function calling più accurato. Il modello è altamente capace per RAG e workflow agentici, risultando una scelta adatta per casi d'uso enterprise come l'esplorazione e la condivisione della conoscenza, la comprensione semantica dei documenti, l'automazione delle attività e il miglioramento delle esperienze cliente.
Mistral Large 24.11 sarà presto disponibile presso i nostri partner cloud provider, a partire da Google Cloud e Microsoft Azure entro una settimana.





