Recherche

Pixtral Large

November 18, 2024

By Mistral AI team

À noter : ce modèle est obsolète

Pixtral Large n’est plus maintenu et a été remplacé par nos derniers modèles vision et multimodaux, plus puissants.

Explorer nos capacités vision actuelles

Pixtral Large en bref :

  • Performances multimodales de pointe

  • État de l’art sur MathVista, DocVQA et VQAv2

  • Étend Mistral Large 2 sans compromettre les performances texte

  • Décodeur multimodal de 123B, encodeur vision de 1B de paramètres

  • Fenêtre de contexte de 128K : contient au moins 30 images haute résolution

  • Utilisation :

    • Essayez-le dans Le Chat

    • Dans notre API sous le nom pixtral-large-latest

    • Téléchargez-le ici

Nous annonçons aujourd’hui Pixtral Large, un modèle multimodal à poids ouverts de 124B construit sur Mistral Large 2. Pixtral Large est le deuxième modèle de notre famille multimodale et montre une compréhension d’image de pointe. Le modèle comprend notamment les documents, les graphiques et les images naturelles, tout en conservant les capacités de compréhension textuelle de premier plan de Mistral Large 2.

Le modèle est disponible sous la Mistral Research License (MRL) pour la recherche et l’enseignement, ainsi que sous la Mistral Commercial License pour l’expérimentation, les tests et la production à des fins commerciales.

Benchmark summary

Performances

Nous évaluons Pixtral Large face à des modèles de pointe sur un ensemble de benchmarks multimodaux standard, avec un même banc de test. Sur MathVista, qui évalue le raisonnement mathématique complexe à partir de données visuelles, notre modèle atteint 69,4 % et surpasse tous les autres modèles. Pour évaluer les capacités de raisonnement sur des graphiques et documents complexes, nous mesurons les performances avec ChartQA et DocVQA, où Pixtral Large dépasse GPT-4o et Gemini-1.5 Pro.

Pixtral Large montre aussi des capacités compétitives sur MM-MT-Bench, en dépassant Claude-3.5 Sonnet (new), Gemini-1.5 Pro et GPT-4o (latest). MM-MT-Bench est une évaluation open source fondée sur un juge, conçue pour refléter les cas d’usage réels des LLM multimodaux (voir le rapport technique Pixtral 12B pour plus de détails).

Detailed benchmarks

Enfin, sur le LMSys Vision Leaderboard, Pixtral Large est le meilleur modèle à poids ouverts avec une marge importante, dépassant son concurrent le plus proche de près de 50 points ELO. Pixtral Large surpasse aussi plusieurs modèles propriétaires, comme GPT-4o (août 2024).

Detailed benchmarks

Exemples qualitatifs

OCR multilingue et raisonnement…

German receipt

Prompt :

J’ai acheté le café et la saucisse. Combien vous dois-je ? Ajoutez un pourboire de 18 %.

Réponse :

Pour calculer le montant total à payer, pourboire de 18 % inclus, suivez ces étapes :

  1. Calculez le coût du café et de la saucisse :

    • 2 x Latte Macchiato : 2 * 4,50 CHF = 9,00 CHF

    • 1 x Schweinschnitzel : 22,00 CHF

    • Coût total du café et de la saucisse : 9,00 CHF + 22,00 CHF = 31,00 CHF

  2. Calculez le pourboire de 18 % :

    • Pourboire : 31,00 CHF * 0,18 = 5,58 CHF

  3. Ajoutez le pourboire au coût total :

    • Montant total dû : 31,00 CHF + 5,58 CHF = 36,58 CHF

Vous devez donc payer un total de 36,58 CHF.

Compréhension de graphiques…

Loss curve

Prompt :

Quand les choses ont-elles commencé à mal tourner pour dark dragon ?

Réponse :

La perte d’entraînement du modèle "dark-dragon-50" commence à montrer une instabilité importante autour du cap des 10 000 steps. On observe un pic net de la valeur de perte à ce stade, puis l’instabilité se poursuit avec un autre pic majeur autour du cap des 20 000 steps. Ces pics indiquent que le processus d’entraînement du modèle "dark-dragon-50" a commencé à rencontrer des problèmes autour de 10 000 steps.

Et plus encore…

Website screenshot

Prompt :

Quelles entreprises utilisent des modèles créés par Mistral AI ?

Réponse :

Les entreprises qui utilisent des modèles créés par Mistral AI, comme le montre l’image, sont :

  1. BNP Paribas

  2. Brave

  3. Cloudflare

  4. CMA CGM

  5. Front

Un dernier point…

En plus de Pixtral Large, Mistral Large, notre modèle texte de pointe, reçoit lui aussi une mise à jour. Le modèle est disponible sous le nom pixtral-large-latest sur notre API, ainsi que pour un déploiement autonome en tant que Mistral Large 24.11 sur HuggingFace sous la Mistral Research License (MRL) pour la recherche, ou avec une licence commerciale de Mistral AI pour un usage commercial.

Ce nouveau modèle apporte une mise à niveau importante par rapport au précédent Mistral Large 24.07, avec des améliorations notables de la compréhension en contexte long, un nouveau prompt système et un function calling plus précis. Le modèle est très performant pour le RAG et les workflows agentiques, ce qui le rend adapté aux cas d’usage d’entreprise comme l’exploration et le partage de connaissances, la compréhension sémantique de documents, l’automatisation des tâches et l’amélioration des expériences client.

Mistral Large 24.11 sera bientôt disponible auprès de nos partenaires cloud providers, à commencer par Google Cloud et Microsoft Azure d’ici une semaine.