Nous annonçons aujourd’hui Mistral Small 4. Ce modèle est la prochaine version majeure de la famille Mistral Small. Mistral Small 4 est le premier modèle Mistral à réunir dans un modèle unique et polyvalent les capacités de nos modèles phares : Magistral pour le raisonnement, Pixtral pour le multimodal et Devstral pour le coding agentique. Avec Small 4, les utilisateurs n’ont plus à choisir entre un modèle instruct rapide, un moteur de raisonnement puissant ou un assistant multimodal : un seul modèle fournit désormais les trois, avec un effort de raisonnement configurable et une efficacité de premier plan.
Mistral Small 4 est publié sous licence Apache 2.0, dans la continuité de notre engagement pour une IA ouverte, accessible et personnalisable.
Un nouveau standard pour les modèles multimodaux optimisés pour le raisonnement
Mistral Small 4 est un modèle hybride optimisé pour le chat général, le coding, les tâches agentiques et le raisonnement complexe. Son architecture prend en charge les entrées texte et image, ce qui le rend polyvalent pour un large éventail d’applications. Avec Mistral Small 4, nous réaffirmons notre engagement en faveur des modèles open source et sommes fiers de rejoindre la NVIDIA Nemotron Coalition en tant que membre fondateur, pour faire avancer la collaboration et l’innovation dans le développement de l’IA.
Détails clés de l’architecture
Mixture of Experts (MoE) : 128 experts, dont 4 actifs par token, pour un passage à l’échelle et une spécialisation efficaces.
119 milliards de paramètres au total, dont 6 milliards de paramètres actifs par token (8 milliards avec les couches d’embedding et de sortie).
Fenêtre de contexte de 256k, avec prise en charge des interactions longues et de l’analyse de documents.
Effort de raisonnement configurable : choisissez entre des réponses rapides à faible latence et des sorties approfondies nécessitant un raisonnement intensif.
Multimodalité native : accepte les entrées texte et image, pour des cas d’usage allant de l’analyse de documents à l’analyse visuelle.
Points clés de performance
Réduction de 40 % du temps de completion de bout en bout (configuration optimisée pour la latence).
3× plus de requêtes par seconde (configuration optimisée pour le débit) par rapport à Mistral Small 3.

Pourquoi Mistral Small 4 ?
Capacités unifiées
Mistral Small 4 réunit les points forts de Magistral (raisonnement), Devstral (agents de code) et Mistral Small (instruct) dans un seul modèle. Que vous ayez besoin d’un assistant de chat, d’un partenaire de recherche ou d’un agent de code, Small 4 s’adapte à votre tâche, sans changer de modèle spécialisé.
Raisonnement à la demande
Avec le nouveau paramètre reasoning_effort, vous pouvez ajuster dynamiquement le comportement du modèle :
reasoning_effort="none": réponses rapides et légères pour les tâches courantes, équivalentes au même style de chat que Mistral Small 3.2.reasoning_effort="high": raisonnement approfondi, étape par étape, pour les problèmes complexes, avec une verbosité équivalente aux modèles Magistral précédents.

Efficacité adaptée aux entreprises
Infrastructure minimale : 4× NVIDIA HGX H100, 2× NVIDIA HGX H200 ou 1× NVIDIA DGX B200.
Configuration recommandée : 4× NVIDIA HGX H100, 4× NVIDIA HGX H200 ou 2× NVIDIA DGX B200 pour des performances optimales.
Mistral Small 4 est entièrement open source. Vous pouvez l’adapter par fine-tuning à des tâches spécialisées ou le déployer sans configuration supplémentaire pour un usage général. Grâce à la collaboration avec la communauté, il est désormais disponible sur vLLM, llama.cpp, SGLang, Transformers, et plus encore.
Fournir des modèles d’IA open source avancés nécessite une optimisation large. Grâce à une collaboration étroite avec NVIDIA, l’inférence a été optimisée pour vLLM et SGLang open source, afin d’assurer un serving efficace à haut débit dans différents scénarios de déploiement.
Figure : score ou longueur de sortie sur trois benchmarks. En haut : scores de précision (plus ils sont élevés, mieux c’est). En bas : longueur moyenne de sortie en milliers de caractères (plus elle est courte, mieux c’est).
Mistral Small 4 avec raisonnement obtient des scores compétitifs, équivalents ou supérieurs à GPT-OSS 120B sur les trois benchmarks, tout en générant des sorties nettement plus courtes. Sur AA LCR, Mistral Small 4 obtient un score de 0,72 avec seulement 1,6k caractère, tandis que les modèles Qwen nécessitent 3,5 à 4× plus de sortie (5,8 à 6,1k) pour des performances comparables. Sur LiveCodeBench, Mistral Small 4 dépasse GPT-OSS 120B tout en produisant 20 % de sortie en moins. Cet écart d’efficacité compte en pratique : des sorties plus courtes signifient une latence plus faible, des coûts d’inférence réduits et une meilleure expérience utilisateur.
Pour les acheteurs en entreprise :
L’efficacité par token a un impact direct sur le coût et la scalabilité. Les modèles qui maintiennent ou améliorent leurs performances à mesure que les réponses s’allongent réduisent le besoin d’intervention manuelle, diminuent les coûts opérationnels et assurent une qualité constante, même pour des tâches complexes et sensibles comme la génération de rapports, le support client ou les workflows de prise de décision. Les modèles de raisonnement hybrides offrent une meilleure valeur en maximisant la précision sans augmentation proportionnelle de l’utilisation des ressources, ce qui les rend adaptés aux déploiements à grande échelle où les performances et l’efficacité des coûts sont essentielles.
Pour les équipes techniques et les data scientists :
La performance par token est une métrique clé pour sélectionner et optimiser un modèle. Les modèles qui passent efficacement à l’échelle permettent aux équipes de déployer des solutions pour des tâches plus longues et plus nuancées (par exemple, analyse détaillée, raisonnement multi-étapes) sans sacrifier la précision ni augmenter les coûts de calcul. Cela réduit les compromis entre qualité et allocation des ressources, et permet de créer des applications d’IA plus innovantes et fiables. Cela simplifie aussi le fine-tuning et l’intégration, car la robustesse du modèle réduit le besoin d’ajustements constants ou de systèmes de fallback.
Cas d’usage prévus
Mistral Small 4 est conçu pour :
Développeurs : automatisation du coding, exploration de codebases et workflows de code agentiques.
Entreprises : assistants de chat général, compréhension de documents et analyse multimodale.
Chercheurs : mathématiques, recherche et tâches de raisonnement complexe.
Sa licence open source et son architecture personnalisable en font un bon choix pour le fine-tuning et la spécialisation.
Disponibilité
API Mistral et AI Studio
Les développeurs peuvent prototyper gratuitement Mistral Small 4 sur l’informatique accélérée NVIDIA à l’adresse build.nvidia.com. Pour le déploiement en production, Mistral Small 4 est disponible dès le jour 0 en tant que NVIDIA NIM, avec une inférence optimisée et conteneurisée prête à l’emploi. Il peut aussi être personnalisé avec NVIDIA NeMo pour le fine-tuning propre à un domaine.
La documentation technique destinée aux clients est disponible sur notre AI Governance Hub
Pour les déploiements en entreprise, le fine-tuning personnalisé ou les solutions sur site, contactez notre équipe.
L’avenir de l’IA est ouvert
En unifiant les capacités instruct, de raisonnement et multimodales, Mistral Small 4 simplifie l’intégration de l’IA et aide les utilisateurs à traiter un éventail plus large de tâches avec un outil unique et adaptable, tout en appliquant les bénéfices de l’IA open source à des cas d’usage concrets.





