L’Office européen des brevets accélère l’innovation avec Mistral.
Des PDF à la sortie structurée : transcription automatisée de brevets à grande échelle.
L’Office européen des brevets accélère l’innovation avec Mistral.
L’Office européen des brevets s’appuie sur Mistral AI pour simplifier le traitement de demandes complexes.
Chiffres clés :
400 000 pages traitées par jour
<1 % de taux d’erreur de reconnaissance des caractères
Délai ramené de 5 jours maximum à quelques minutes
« Les outils OCR standard atteignent souvent leurs limites face à la complexité des documents de brevet. Ce qui comptait pour nous, c’était la conformité à ST36 et la fiabilité sur des éléments complexes comme les tableaux, les formules et les figures, à fort volume. L’expertise OCR de Mistral AI répondait directement à l’exigence de tolérance quasi nulle aux erreurs requise par notre procédure de délivrance des brevets. »
Angel Aledo Lopez, directeur des opérations et directeur de la technologie, Office européen des brevets.
L’Office européen des brevets (OEB) joue un rôle central dans l’écosystème européen de l’innovation. Il traite chaque année des millions de pages de documents de brevet. Pour maintenir qualité et efficacité, la transcription des documents doit être presque sans erreur et conforme à la norme sectorielle ST36 XML. L’OEB s’est associé à Mistral AI pour moderniser ses capacités. Pendant une preuve de concept de trois mois, Mistral AI a déployé une technologie avancée de reconnaissance optique de caractères (OCR), atteignant une tolérance aux erreurs quasi nulle et améliorant l’efficacité du traitement des données complexes essentielles au cycle de vie des brevets.
Traiter la complexité technique à grande échelle
Le principal obstacle pour l’OEB est l’extrême densité technique des demandes de brevet. Les documents de brevet intègrent souvent des formules mathématiques, des structures chimiques, des images détaillées et des tableaux complexes au sein de textes rédigés dans plusieurs langues européennes. Ces éléments sont notoirement difficiles à interpréter pour les outils numériques standard, ce qui entraîne souvent une structuration incomplète ou inexacte des données.
Pour l’OEB, la réalité opérationnelle était claire : il lui fallait une solution évolutive capable de traiter des volumes massifs de données complexes sans perdre en précision. Pour maintenir le haut niveau de qualité de la procédure de délivrance des brevets, l’OEB avait besoin d’un système de transcription automatisé capable de lire les éléments scientifiques et techniques avec une précision maximale, tout en produisant une sortie structurée conforme à ST36.
Partenariat avec Mistral AI : une solution sur mesure de bout en bout
Pour répondre à ces défis précis, l’OEB et Mistral AI ont lancé une preuve de concept collaborative. Contrairement à une relation fournisseur classique, ce Projet a réuni des équipes dédiées travaillant côte à côte pour combiner la connaissance métier approfondie de l’OEB avec les capacités d’IA dernière génération de Mistral. Cette collaboration a permis des itérations rapides, afin d’adapter la technologie à la réalité opérationnelle de l’OEB, et non l’inverse.
Le cœur de la solution comprenait un modèle OCR 1B, entraîné spécifiquement par fine-tuning sur plus de 150 000 PDF, représentant 50 000 brevets uniques. L’équipe a développé un pipeline sophistiqué qui convertit avec succès des documents de brevet complexes et multidimensionnels depuis Markdown vers HTML, puis enfin vers le format ST36 XML requis. Ce pipeline spécialisé garantit que le modèle peut traiter la diversité des formats de documents de brevet européens que les outils prêts à l’emploi ne parviennent pas à gérer.
Au-delà du modèle lui-même, l’équipe a livré une application évolutive et tolérante aux pannes, conçue pour la fiabilité et la conformité complète aux normes sectorielles, prête pour un déploiement sur site.

Figure : automatisation de la transcription de brevets avec le modèle OCR entraîné par fine-tuning pour l’OEB
Améliorer la précision et l’efficacité de l’examen des brevets
La solution déployée a nettement amélioré la précision de l’extraction des données. Le modèle entraîné par fine-tuning a démontré une meilleure capacité à traiter les éléments les plus difficiles des demandes de brevet, en particulier les formules complexes et les images techniques. Concrètement, le système a atteint un débit de 400 000 pages transcrites par jour, tout en maintenant un taux d’erreur de reconnaissance des caractères inférieur à 1 %. Ce gain permet aussi de traiter les demandes de brevet plus rapidement.
Le succès de la solution valide l’utilisation d’une IA avancée dans des environnements administratifs exigeants. Avec un système hautement évolutif déjà en place, l’OEB peut automatiser l’extraction des données structurelles afin d’améliorer l’efficacité globale. L’OEB peut ainsi concentrer ses ressources expertes sur la tâche à forte valeur de l’examen des brevets, tout en respectant des normes de qualité strictes et des exigences de tolérance quasi nulle aux erreurs.




