European Patent Office and Mistral. (black)

Dai PDF all'output strutturato: trascrizione automatizzata dei brevetti su larga scala.

L'Ufficio europeo dei brevetti accelera l'innovazione con Mistral.

European Patent Office showcase lightbulb

L'Ufficio europeo dei brevetti sfrutta Mistral AI per semplificare l'elaborazione di domande complesse.

Statistiche:

  • 400.000 pagine/giorno di throughput

  • <1% tasso di errore nel riconoscimento dei caratteri

  • Lead time da un massimo di 5 giorni a pochi minuti 

"Gli strumenti OCR standard spesso non sono all'altezza quando si confrontano con le complessità dei documenti brevettuali. Per noi contavano la conformità ST36 e l'affidabilità su elementi complessi come tabelle, formule e figure, a volumi elevati. L'esperienza OCR di Mistral AI ha risposto direttamente alla tolleranza agli errori prossima allo zero richiesta dal nostro processo di concessione dei brevetti."
Angel Aledo Lopez, Chief Operating Officer e Chief Technology Officer, Ufficio europeo dei brevetti.

L'Ufficio europeo dei brevetti (EPO) è in prima linea nell'ecosistema europeo dell'innovazione. Elabora ogni anno milioni di pagine di documenti brevettuali e, per mantenere qualità ed efficienza, la trascrizione dei documenti deve essere pressoché priva di errori e conforme allo standard di settore ST36 XML. L'EPO ha collaborato con Mistral AI per modernizzare le proprie capacità. Nell'arco di una proof of concept di tre mesi, Mistral AI ha implementato una tecnologia avanzata di Optical Character Recognition (OCR), ottenendo una tolleranza agli errori prossima allo zero e sbloccando nuove efficienze nella gestione dei dati complessi essenziali per il ciclo di vita dei brevetti.

Gestire la complessità tecnica su larga scala

Il principale ostacolo per l'EPO è l'estrema densità tecnica delle domande di brevetto. I documenti brevettuali incorporano spesso formule matematiche, strutture chimiche, immagini dettagliate e tabelle complesse all'interno di testi in più lingue europee. Questi elementi sono notoriamente difficili da interpretare per gli strumenti digitali standard e portano spesso a una strutturazione dei dati incompleta o imprecisa.

Per l'EPO, la realtà operativa era chiara: serviva una soluzione scalabile in grado di gestire volumi massicci di dati complessi senza sacrificare l'accuratezza. Per mantenere l'elevata qualità del processo di concessione dei brevetti, l'EPO aveva bisogno di un sistema di trascrizione automatizzato capace di leggere in modo impeccabile elementi scientifici e tecnici, producendo al contempo un output strutturato conforme a ST36.

Partnership con Mistral AI: una soluzione end-to-end su misura

Per affrontare queste sfide specifiche, l'EPO e Mistral AI hanno avviato una proof of concept collaborativa. Diversamente da una normale relazione con un fornitore, questo progetto ha coinvolto team dedicati che hanno lavorato fianco a fianco per combinare la profonda conoscenza di dominio dell'EPO con le capacità AI all'avanguardia di Mistral. Questa sinergia ha consentito iterazioni rapide, assicurando che la tecnologia fosse adattata alla realtà operativa dell'EPO, e non il contrario.​

Il cuore della soluzione includeva un modello OCR da 1B, sottoposto a fine-tuning specificamente su oltre 150.000 PDF, rappresentativi di 50.000 brevetti unici. Il team ha sviluppato una pipeline sofisticata che converte con successo documenti brevettuali complessi e articolati da Markdown a HTML e infine nel formato ST36 XML richiesto. Questa pipeline specializzata garantisce che il modello possa gestire la varietà di formati dei documenti brevettuali europei che gli strumenti off-the-shelf non riescono a elaborare.

Oltre al modello in sé, il team ha fornito un'applicazione scalabile e fault-tolerant, progettata per affidabilità e piena conformità agli standard di settore, pronta per il deployment on-premises.

Figura: automazione della trascrizione dei brevetti con modello OCR sottoposto a fine-tuning per l'EPO

Promuovere precisione ed efficienza nell'esame dei brevetti

La soluzione implementata ha prodotto miglioramenti sostanziali nell'accuratezza dell'estrazione dei dati. Il modello sottoposto a fine-tuning ha dimostrato una capacità superiore nel gestire gli elementi più difficili delle domande di brevetto, in particolare formule complesse e immagini tecniche. Nello specifico, il sistema ha raggiunto un throughput di 400.000 pagine trascritte al giorno, mantenendo un tasso di errore nel riconoscimento dei caratteri inferiore all'1%. Questo beneficio consente anche un'elaborazione più rapida delle domande di brevetto.

Il successo della soluzione conferma la validità dell'uso di AI avanzata in ambienti amministrativi rigorosi. Con un sistema altamente scalabile già operativo, l'EPO può automatizzare l'estrazione dei dati strutturali per migliorare l'efficienza complessiva. Ciò consente all'EPO di concentrare le proprie risorse esperte sull'attività ad alto valore dell'esame dei brevetti, rispettando rigorosi standard di qualità e requisiti di tolleranza agli errori prossimi allo zero.