Soluzioni

Pixtral Large

November 18, 2024

By Mistral AI team

Nota: questo modello è deprecato

Pixtral Large non è più mantenuto ed è stato sostituito dai nostri modelli vision e multimodali più recenti e potenti.

Esplori le nostre attuali capacità vision

Pixtral Large in breve:

  • Prestazioni multimodali all'avanguardia

  • Stato dell'arte su MathVista, DocVQA, VQAv2

  • Estende Mistral Large 2 senza compromettere le prestazioni sul testo

  • Decoder multimodale da 123B, encoder visivo da 1B di parametri

  • Finestra di contesto da 128K: contiene almeno 30 immagini ad alta risoluzione

  • Uso:

    • Provalo su Le Chat

    • Nella nostra API come pixtral-large-latest

    • Scaricalo qui

Oggi annunciamo Pixtral Large, un modello multimodale open-weights da 124B costruito su Mistral Large 2. Pixtral Large è il secondo modello della nostra famiglia multimodale e dimostra capacità di comprensione delle immagini all'avanguardia. In particolare, il modello è in grado di comprendere documenti, grafici e immagini naturali, mantenendo al tempo stesso la comprensione testuale leader di Mistral Large 2.

Il modello è disponibile con la Mistral Research License (MRL) per uso di ricerca e didattico; e con la Mistral Commercial License per sperimentazione, test e produzione a fini commerciali.

Benchmark summary

Prestazioni

Valutiamo Pixtral Large rispetto a modelli all'avanguardia su un insieme di benchmark multimodali standard, tramite un harness di test comune. Su MathVista, che valuta il ragionamento matematico complesso su dati visivi, il nostro modello raggiunge il 69,4%, superando tutti gli altri modelli. Per valutare le capacità di ragionamento su grafici e documenti complessi, misuriamo le prestazioni con ChartQA e DocVQA, dove Pixtral Large supera GPT-4o e Gemini-1.5 Pro.

Pixtral Large dimostra inoltre capacità competitive su MM-MT-Bench, superando Claude-3.5 Sonnet (nuovo), Gemini-1.5 Pro e GPT-4o (più recente). MM-MT-Bench è una valutazione open-source basata su giudice, pensata per riflettere casi d'uso reali degli LLM multimodali (veda il report tecnico di Pixtral 12B per i dettagli).

Detailed benchmarks

Infine, nella LMSys Vision Leaderboard, Pixtral Large è il miglior modello open-weights con un margine sostanziale, superando il concorrente più vicino di quasi 50 punti ELO. Pixtral Large supera inoltre diversi modelli proprietari, come GPT-4o (agosto '24).

Detailed benchmarks

Esempi qualitativi

OCR e ragionamento multilingue...

German receipt

Prompt:

Ho comprato il caffè e la salsiccia. Quanto devo? Aggiungi una mancia del 18%.

Risposta:

Per calcolare l'importo totale dovuto, inclusa la mancia del 18%, segua questi passaggi:

  1. Calcolare il costo del caffè e della salsiccia:

    • 2x Latte Macchiato: 2 * 4.50 CHF = 9.00 CHF

    • 1x Schweinschnitzel: 22.00 CHF

    • Costo totale per caffè e salsiccia: 9.00 CHF + 22.00 CHF = 31.00 CHF

  2. Calcolare la mancia del 18%:

    • Mancia: 31.00 CHF * 0.18 = 5.58 CHF

  3. Aggiungere la mancia al costo totale:

    • Importo totale dovuto: 31.00 CHF + 5.58 CHF = 36.58 CHF

Quindi, il totale dovuto è 36.58 CHF.

Comprensione dei grafici...

Loss curve

Prompt:

Quando hanno iniziato ad andare male le cose per dark dragon?

Risposta:

La perdita di training per il modello "dark-dragon-50" inizia a mostrare un'instabilità significativa intorno alla soglia dei 10.000 step. In questo punto si osserva un picco evidente nel valore della loss, e l'instabilità continua con un altro picco importante intorno alla soglia dei 20.000 step. Questi picchi indicano che il processo di training del modello "dark-dragon-50" ha iniziato a incontrare problemi a partire da circa 10.000 step.

E altro ancora...

Website screenshot

Prompt:

Quali aziende usano modelli realizzati da Mistral AI?

Risposta:

Le aziende che usano modelli realizzati da Mistral AI, come mostrato nell'immagine, sono:

  1. BNP Paribas

  2. Brave

  3. Cloudflare

  4. CMA CGM

  5. Front

Un'ultima cosa...

Insieme a Pixtral Large, anche Mistral Large, il nostro modello testuale allo stato dell'arte, riceve un aggiornamento. Il modello è disponibile come pixtral-large-latest sulla nostra API, nonché per il self-deployment come Mistral Large 24.11 su HuggingFace con la Mistral Research License (MRL) per la ricerca, oppure con una licenza commerciale di Mistral AI per uso commerciale.

Questo modello più recente offre un aggiornamento significativo rispetto al precedente Mistral Large 24.07, con miglioramenti notevoli nella comprensione di contesti lunghi, un nuovo system prompt e function calling più accurato. Il modello è altamente capace per RAG e workflow agentici, risultando una scelta adatta per casi d'uso enterprise come l'esplorazione e la condivisione della conoscenza, la comprensione semantica dei documenti, l'automazione delle attività e il miglioramento delle esperienze cliente.

Mistral Large 24.11 sarà presto disponibile presso i nostri partner cloud provider, a partire da Google Cloud e Microsoft Azure entro una settimana.