Soluzioni

Introducing

OCR 4

June 23, 2026

By Mistral AI

Title

Subtitle

Text

Image

Image

Table

Summary

Mistral OCR 4 introduce un'analisi documentale rivoluzionaria con bounding box, classificazione dei blocchi e punteggi di confidenza inline, supportando 170 lingue ed eseguendosi in un singolo container per deployment self-hosted. Supera i principali sistemi OCR nelle valutazioni umane e nei benchmark, offrendo al contempo elaborazione ad alto throughput ed efficiente in termini di costi per enterprise search, RAG e workflow agentici. Disponibile via API o Document AI, fornisce output strutturati per pipeline personalizzate o applicazioni no-code, con opzioni di self-hosting per la privacy dei dati.

Oggi rilasciamo Mistral OCR 4, con bounding box, classificazione dei blocchi e punteggi di confidenza inline insieme al testo estratto. Il modello supporta 170 lingue in 10 gruppi linguistici, viene eseguito in un unico container per deployment completamente self-hosted e funge da componente di ingestion per ricerca enterprise, RAG e pipeline di retrieval specifiche di dominio. OCR 4 è un modello piccolo e focalizzato; questo post illustra le novità, le sue prestazioni su benchmark pubblici e interni, i limiti noti di tali benchmark e le indicazioni su quando utilizzare l’API del modello rispetto a Document AI.

Punti salienti

  • Prestazioni rivoluzionarie. Annotatori indipendenti preferiscono OCR 4 rispetto a tutti i principali sistemi OCR e document-AI testati, con win rate medi del 72%, oltre al miglior punteggio complessivo su OlmOCRBench (85,20). Vedere la sezione Benchmark di seguito per la metodologia e i limiti noti di scoring.

  • Segmentazione, non solo testo. Insieme al testo estratto, OCR 4 restituisce bounding box, classificazione dei blocchi tipizzati (titoli, tabelle, equazioni, firme e altro) e punteggi di confidenza inline. Le bounding box, la capacità più richiesta, localizzano il testo per l’evidenziazione in contesto e pipeline dati affidabili. Allo stesso tempo, i tipi di blocco e i punteggi di confidenza abilitano citazioni ancorate alla fonte, redazioni e verifica human-in-the-loop.

  • Integrato con Mistral Search Toolkit (anteprima pubblica). OCR 4 è un componente di ingestion di Search Toolkit, il framework di ricerca open-source e componibile di Mistral, annunciato all’AI Now Summit. Il suo output strutturato fornisce input pronti per la citazione al workflow di ingestion, retrieval e valutazione del toolkit per RAG e ricerca enterprise.

  • Copertura multilingue. Supporto per 170 lingue in 10 gruppi linguistici, con miglioramenti misurabili su lingue specialistiche e a basse risorse, dove diversi sistemi concorrenti degradano.

  • Esecuzione sulla propria infrastruttura. OCR 4 è abbastanza compatto da poter essere distribuito in un unico container, mantenendo i dati dei documenti nel proprio ambiente per residenza, sovranità e compliance, supportando al contempo elaborazioni batch cost-efficient e ad alto throughput. Il deployment self-managed è disponibile per i clienti enterprise.

Panoramica

Mistral OCR 4 estrae e struttura contenuti da un’ampia gamma di documenti. Mentre le generazioni precedenti si concentravano sulla conversione di una pagina in testo e tabelle puliti, OCR 4 restituisce una rappresentazione strutturata del documento. Ogni blocco è localizzato con una bounding box, classificato per tipo, e vengono generati punteggi di confidenza inline per pagina e per parola. I sistemi downstream, quindi, hanno accesso non solo a ciò che dice il documento, ma anche a dove si trova ciascun elemento, quale ruolo svolge e quanto è sicuro il modello in ogni regione.

Questa struttura supporta diversi carichi di lavoro downstream:

  • Chunking semantico per RAG: blocchi puliti e classificati diventano unità di retrieval migliori.

  • Primitive strutturali per agenti: gli agenti passano dalla lettura dei documenti all’azione su di essi (compilazione di moduli, elaborazione di fatture, controlli di compliance).

  • Contenuti strutturati per connettori: output coerente e tipizzato per pipeline di ingestion e indicizzazione.

OCR 4 accetta formati enterprise comuni, inclusi PDF, DOC, PPT e OpenDocument, e supporta 170 lingue in 10 gruppi linguistici, comprese lingue specialistiche e a basse risorse che molti sistemi gestiscono con difficoltà. Essendo un modello compatto distribuibile in un unico container, è adatto sia a deployment sensibili ai costi sia ad alto volume. Può essere eseguito in modalità completamente self-hosted, consentendo alle organizzazioni con requisiti di sovranità dei dati di mantenere i dati dei documenti all’interno della propria infrastruttura.

Gli sviluppatori integrano il modello tramite API, mentre i team possono usare Document AI in Mistral Studio per un percorso no-code a livello applicativo verso lo stesso motore. Mistral OCR 4 tramite API ha un prezzo di 4 $ per 1.000 pagine, con uno sconto Batch-API del 50%, che riduce il costo a 2 $ per 1.000 pagine. Document AI ha un prezzo di 5 $ per 1.000 pagine.

Benchmark

“Abbiamo confrontato Mistral OCR 4 con i principali parser documentali agentic su un dataset di QA finanziario ricco di grafici e figure, ottenendo un’accuratezza equivalente a un costo circa 8 volte inferiore e con una latenza 17 volte più bassa. Per casi d’uso in produzione su larga scala, questo differenziale si accumula rapidamente.”
- Aidan Donohue, AI Engineer, Rogo

Per valutare OCR 4, lo abbiamo confrontato con i principali modelli OCR AI-native, modelli general-purpose all’avanguardia, servizi documentali enterprise e il nostro Mistral OCR 3.

Valutazioni delle preferenze umane

I benchmark automatizzati presentano gli artefatti di scoring descritti sopra, quindi li abbiamo integrati con una valutazione umana head-to-head su documenti scelti per riflettere l’uso reale. Abbiamo raccolto oltre 600 documenti in più di 12 lingue, forniti da vendor terzi per rappresentare casi d’uso reali del settore, e abbiamo chiesto ad annotatori indipendenti di classificare alla cieca l’output di ciascun concorrente rispetto a quello di OCR 4, documento per documento.

Gli annotatori hanno preferito OCR 4 nella maggior parte dei documenti in tutti i sistemi testati. Poiché si tratta di giudizi umani su documenti realistici, anziché di confronti di stringhe con riferimenti fissi, evitano gran parte del rumore di annotazione e formattazione che influisce sui punteggi automatizzati.

Prestazioni complessive

“Mistral OCR è circa 4 volte più veloce per pagina rispetto al nostro provider precedente, un risultato notevole per i workflow di docketing ad alto volume, dove la velocità è essenziale per gestire le scadenze IP dei nostri clienti.”
- Ivan Mihailov, AI engineer, Anaqua

Oltre a classificarsi al primo posto nelle nostre preferenze umane, OCR 4 ottiene il miglior punteggio complessivo tra i modelli che abbiamo testato sul benchmark pubblico OlmOCRBench (85,20) e guida la nostra valutazione interna Crawl Multilingual (.98), davanti sia alle soluzioni AI-native sia a quelle enterprise.

Su OmniDocBench, OCR 4 ottiene un punteggio di 93,07. Riportiamo questo dato con una precisazione: sia OlmOCRBench sia OmniDocBench presentano limiti noti nel modo in cui valutano determinati output, e un singolo numero aggregato può sia sottostimare sia sovrastimare le prestazioni nel mondo reale.

Quando abbiamo analizzato le discrepanze alla base dei nostri punteggi, la maggior parte non era dovuta a errori del modello, ma ad artefatti nel modo in cui i benchmark confrontano l’output. Le categorie ricorrenti:

  • Errori nel ground truth. Alcune annotazioni di riferimento sono esse stesse errate: testo mancante o in eccesso, trascrizioni di aree redatte o refusi (ad esempio, il nome di un autore citato scritto in modo errato nel riferimento ma letto correttamente dal modello dalla pagina). L’output corrisponde al documento sorgente, eppure viene comunque contrassegnato come errato.

  • Notazione matematica equivalente. LaTeX diverso che viene renderizzato in modo identico viene conteggiato come mismatch. L’equazione renderizzata è corretta; il confronto tra stringhe no.

  • Segmentazione delle equazioni. Il fatto che un’espressione venga emessa come una singola equazione o suddivisa in più frammenti inline influisce sulla corrispondenza, anche quando il contenuto renderizzato è identico, perché il matcher non riesce ad allineare i pezzi.

  • Ordine di lettura multi-colonna. Parole divise sul limite di una colonna (ad esempio, «certifi-cates») e assunzioni sull’ordine delle colonne fanno sì che estrazioni corrette vengano valutate come errori di ordine di lettura.

  • Attribuzione del tipo di blocco. Il benchmark non si aspetta intestazioni/piè di pagina nell’output. Per risolvere questo problema rimuoviamo intestazioni e piè di pagina dal nostro output prima dello scoring. Tuttavia, il test verifica poi una stringa che coincide anche con il titolo della pagina, che in realtà dovrebbe essere presente, e la segnala erroneamente.

Questi artefatti si concentrano nei documenti matematici, scientifici e multi-colonna e penalizzano più spesso output corretti di quanto premino output errati. Trattiamo quindi il punteggio aggregato come indicativo, non definitivo.

Questi benchmark sono indicativi. Tutti i punteggi dei concorrenti riflettono riproduzioni interne. Consigliamo di effettuare la valutazione sui propri documenti.

Dettagli sulle prestazioni

Dettaglio Crawl Multilingual. Nella nostra valutazione multilingue interna, OCR 4 è in testa in tutti gli otto gruppi linguistici: inglese, Europa occidentale, Europa orientale, Medio Oriente, cinese, Asia orientale, Sud-est asiatico e lingue specialistiche (hindi, giapponese, georgiano, bengalese, armeno, ebraico, greco, gujarati, tamil, malayalam, kannada, telugu). Il divario è più ampio per le lingue specialistiche e a basse risorse, dove molti sistemi concorrenti degradano bruscamente, mentre OCR 4 mantiene un’accuratezza elevata.

Casi d’uso consigliati

OCR 4 supporta sia pipeline ad alto volume sia workflow documentali interattivi, tra cui:

  • Parsing ed estrazione di documenti: documenti complessi e multilingue.

  • Retrieval-Augmented Generation (RAG): contenuti strutturati, classificati e pronti per la citazione per chunking semantico e risposte ancorate alle fonti. Con Search Toolkit, l’output di OCR 4 può essere inserito direttamente nelle pipeline di retrieval.

  • Workflow agentic: forniscono agli agenti le primitive strutturali per completare attività come la compilazione di moduli, l’elaborazione di fatture e i controlli di compliance, soprattutto nei settori legale, dei servizi finanziari e sanitario.

  • Pipeline di dati strutturati che utilizzano punteggi di confidenza per abilitare un uso efficiente di verificatori umani: estrazione da moduli/fatture, redazioni e processi guidati dalla compliance.

  • Ricerca enterprise e knowledge base: OCR come componente di data source per ingestion personalizzata ed estrazione di entità.

I primi utenti stanno applicando OCR 4 per trasformare fatture in campi strutturati, digitalizzare archivi aziendali, estrarre testo pulito da report tecnici e scientifici e alimentare la ricerca enterprise.

Una nota sull'uso fuori ambito. OCR 4 è un modello di comprensione dei documenti, non un decisore. Non è destinato a diagnosi mediche, consulenza o giudizio legale, decisioni finanziarie ad alto impatto, sistemi safety-critical, elaborazione in tempo reale o sensibile alla latenza, né input non documentali (audio grezzo, video, ecc.).

API OCR 4: comprendere le opzioni disponibili

OCR 4 di Mistral è disponibile tramite un unico endpoint API. Ogni richiesta esegue lo stesso modello OCR sottostante e restituisce sempre contenuto estratto, bounding box, tipi di blocco, punteggi di confidenza e testo strutturato in markdown. A variare è quanto si aggiunge sopra questo livello.

Usare OCR 4 in modalità di estrazione pura quando si desidera:

  • Integrare l'estrazione documentale rapida e accurata direttamente nell'applicazione, nell'agente o nella data pipeline.

  • Lavorare direttamente con la risposta grezza, le bounding box, i tipi di blocco e i punteggi di confidenza per alimentare logiche downstream personalizzate.

  • Eseguire ingestion ad alto volume o in batch con pieno controllo su throughput e costi tramite la Batch API.

  • Effettuare il self-hosting per requisiti stringenti di privacy dei dati, sovranità o conformità.

Attivare le funzionalità di Document AI (stesso endpoint, parametri aggiuntivi) quando si desidera:

  • Restituire JSON strutturato in uno schema definito dall'utente: passando uno schema JSON insieme al documento, l'output OCR viene fornito a mistral-small-2603 per generare contenuti conformi alle specifiche definite.

  • Annotare le immagini rilevate con JSON strutturato passando uno schema di annotazione delle immagini, attivando una chiamata aggiuntiva a un modello vision-language per ogni immagine.

  • Usare un prompt personalizzato insieme a uno schema JSON per guidare l'interpretazione o il riepilogo del contenuto estratto dall'intero documento.

  • Consentire a utenti business, team di soluzioni o gruppi pilota di produrre risultati strutturati senza scrivere logica di parsing downstream.

La regola pratica è: se serve contenuto estratto grezzo, usare OCR 4 così com'è. Se serve rimodellare l'output in un formato strutturato, annotarlo con campi specifici del dominio o elaborarlo con un'istruzione personalizzata, aggiungere i parametri di Document AI alla stessa chiamata. Il risultato OCR viene sempre restituito; Document AI aggiunge semplicemente livelli strutturati sopra di esso.

Ora disponibile

“La disponibilità di Mistral Document AI con OCR 4 in Microsoft Foundry segna una tappa importante nella nostra partnership. Insieme, consentiamo ai clienti di portare la comprensione documentale avanzata e strutturata direttamente nei loro workflow AI, combinando l'innovazione di Mistral con la piattaforma enterprise di Microsoft per offrire soluzioni scalabili e affidabili per esigenze aziendali reali.”
-Kimmi Grewal, VP, Partnership per l'ecosistema AI, Microsoft

Sia Mistral OCRv4 sia Document AI (basato su OCRv4) sono disponibili via API tramite Mistral Studio, Amazon SageMaker, Microsoft Foundry e, prossimamente, Snowflake Parse Document. Per le organizzazioni con requisiti rigorosi di privacy dei dati, OCR 4 offre anche un'opzione di self-hosting affinché le informazioni sensibili restino nella propria infrastruttura. Per esplorare il self-deployment, ci contatti

Iniziare

Offriamo diversi modi per iniziare e approfondire rapidamente.

OCR 4.1

New

The world’s best document extraction and understanding model.

OCR

Multimodale

Testo-a-testo

OCR

$4

/ 1000 pages

Document AI

$5

/ 1000 pages