Le fine-tuning des modèles de fondation transforme la manière dont nous appliquons l'IA à des problèmes concrets. En adaptant des modèles pré-entraînés à des domaines spécifiques, nous pouvons obtenir de bien meilleures performances sur des tâches spécialisées. Nous présentons ici comment le fine-tuning de Pixtral-12B sur de l'imagerie satellite apporte des améliorations significatives par rapport au modèle de base, et montre l'intérêt d'une adaptation propre à un domaine.
Le fine-tuning LoRA permet d'adapter efficacement les poids du modèle à des tâches spécifiques
Le fine-tuning de grands modèles de langage peut demander beaucoup de ressources, mais des techniques comme Low-Rank Adaptation (LoRA) le rendent bien plus efficace. LoRA fonctionne en injectant de petites matrices de décomposition de rang entraînables dans les poids du modèle, ce qui permet une adaptation ciblée sans modifier le modèle complet. Cette approche permet aux développeurs d'adapter des modèles à des tâches spécifiques, qu'il s'agisse d'apprendre le vocabulaire d'un domaine, d'adopter un ton particulier ou d'intégrer des connaissances spécialisées, sans réentraîner l'ensemble du modèle.
Cette méthode est particulièrement utile lorsque l'ingénierie de prompt ou les exemples few-shot ne suffisent pas. Les prompts complexes peuvent devenir difficiles à maintenir et produire des résultats incohérents. Avec le fine-tuning basé sur LoRA, quelques exemples soigneusement sélectionnés peuvent orienter le modèle de façon plus fiable, avec de meilleures performances et moins de surcharge.
L'importance des modèles spécialisés pour l'imagerie satellite
L'imagerie satellite est un domaine visuel très spécialisé, avec des applications critiques dans l'économie mondiale. Du suivi de la déforestation à la surveillance des changements environnementaux, en passant par la détection de menaces émergentes, ces images alimentent des décisions à fort enjeu dans les administrations, l'agriculture, la défense et les sciences du climat. Pour en extraire des informations fiables, les modèles doivent être finement spécialisés sur les motifs et la sémantique propres aux données satellite. C'est là que le fine-tuning de Pixtral-12B intervient, en reliant les modèles de vision généralistes à une expertise spécifique au domaine.
Étude de cas : classification d'images satellite issues de l'Aerial Image Dataset
Pour montrer l'impact du fine-tuning, nous avons utilisé l'Aerial Image Dataset (AID), introduit par Xia et al sous licence Public Domain. Ce benchmark consiste à classer des images satellite dans des catégories de scènes détaillées. Beaucoup de ces classes, comme dense residential ou medium residential, ou encore des termes ambigus comme « center », sont difficiles à traiter pour des modèles vision-langage généralistes sans contexte propre au domaine. Le fine-tuning fournit ce contexte au modèle, ce qui permet une classification plus précise et plus nuancée.

Notez que des modèles de vision plus petits et spécialisés pourraient potentiellement atteindre des niveaux de performance comparables. Cet article vise à vous guider dans le fine-tuning efficace du Vision Language Model (VLM) de Mistral à partir d'un exemple simple, et à montrer son impact sur des métriques de classification de base. Des applications plus avancées du fine-tuning pourraient inclure des interactions comme « parler avec une image » ou la génération de légendes d'images.
Pixtral-12B sans fine-tuning obtient des résultats corrects, mais reste limité sur les classes ambiguës
Nous avons commencé avec une configuration de classification classique, en divisant le jeu de données en 8 000 échantillons d'entraînement et 2 000 échantillons de test. Avec un prompt système listant toutes les classes cibles et imposant un format de sortie structuré, nous avons obtenu des résultats de base raisonnables. Cependant, les performances variaient fortement selon les classes, en particulier celles qui présentent des distinctions visuelles subtiles. De plus, comme le modèle de langage n'est pas explicitement contraint à l'ensemble des libellés, il hallucinait parfois des noms de classes inexistants ou invalides, ce qui met en évidence les limites des approches reposant uniquement sur le prompt.
Prompt système de classification
Classez l'image suivante dans la catégorie à laquelle elle appartient.
- Ces libellés de catégories sont Desert; BareLand; RailwayStation; Mountain; Parking; River; Church; MediumResidential; Commercial; Forest; Airport; Bridge; Park; Farmland; SparseResidential; BaseballField; School; Playground; Square; Stadium; Meadow; Beach; Resort; DenseResidential; Port; StorageTanks; Pond; Viaduct; Industrial; Center.
- Produisez votre résultat en utilisant exclusivement le schéma suivant : {'image_description': FieldInfo(annotation=str, required=True), 'label': FieldInfo(annotation=str, required=True)}
- Placez vos résultats entre une balise json
```json ```

Certaines classes peuvent être difficiles à distinguer sans connaissances préalables ni critères spécifiques. Par exemple, observez les images ci-dessous : elles montrent un « Playground » à gauche et un « Stadium » à droite. Le modèle Pixtral de base classe les deux comme « Stadium ». En regardant de plus près, la principale différence est la présence de sièges autour du terrain de sport. Nous estimons que le fine-tuning aide à capturer ces nuances.

Le fine-tuning d'un modèle Mistral est simple avec notre API et l'interface LaPlateforme
Pour améliorer ces résultats, nous avons effectué le fine-tuning de Pixtral-12B avec l'API de fine-tuning de Mistral. La stratégie de fine-tuning consistait à fournir la bonne étiquette dans la « réponse de l'assistant » pour un prompt système et une image d'entrée. Aucun réglage approfondi des hyperparamètres n'a été nécessaire ici, ce qui rend le processus efficace et économique.
Une autre option consiste à lancer des jobs de fine-tuning via l'interface LaPlateforme

Sélection des hyperparamètres
Le choix des bons hyperparamètres est essentiel pour réussir un fine-tuning. Quelques recommandations :
Learning rate : commencez avec un learning rate faible pour éviter de dépasser les poids optimaux.
Taille de batch : utilisez une taille de batch compatible avec vos ressources de calcul, tout en conservant des gradients stables.
Époques : commencez par une seule époque et surveillez les performances. Vous pouvez ajouter des époques si nécessaire, mais nous recommandons de surveiller de près le risque de surapprentissage.
Note : les appels directs à l'API de fine-tuning Mistral vous donnent plus de contrôle sur les hyperparamètres. Sur LaPlateforme, vous devez seulement fournir le learning rate souhaité et le nombre d'époques ; le moteur de fine-tuning calcule ensuite la taille de batch optimale selon la taille de votre jeu de données et nos benchmarks internes sur le nombre optimal de tokens par batch.
Le fine-tuning améliore les performances du modèle d'un facteur 1,6

Après le fine-tuning, nous avons observé une nette progression des métriques de classification pour toutes les classes. Par exemple, l'exactitude globale est passée de 0,56 à 0,91. Les performances du modèle sont devenues plus homogènes entre les classes, et les hallucinations ont été fortement réduites, de 5 % à 0,1 %. Les résultats ne sont pas parfaits à 100 %, mais l'amélioration est substantielle, surtout compte tenu du budget limité, inférieur ou égal à 10 $, et du nombre relativement réduit d'échantillons, avec 8 000 exemples répartis sur 30 classes.

Conclusion
Le fine-tuning de Pixtral-12B sur de l'imagerie satellite montre l'efficacité de techniques comme LoRA pour améliorer fortement les performances d'un modèle. Cette approche est économique et scalable, ce qui la rend adaptée à de nombreuses applications. Les cas typiques incluent des données très spécialisées, souvent propriétaires, sous-représentées dans les jeux d'entraînement des VLM traditionnels. Il peut s'agir, par exemple, de légendes d'images médicales, de rapports détaillés à partir d'images de surveillance ou de transcription de manuscrits anciens.
Pour plus de détails sur l'implémentation, consultez notre cookbook : https://github.com/mistralai/cookbook/blob/main/mistral/fine_tune/pixtral_finetune_on_satellite_data.ipynb
Nous contacter
Vous souhaitez travailler sur un cas plus personnalisé avec l'équipe Mistral AI ? Contactez-nous pour bénéficier d'un accompagnement sur votre solution et découvrir comment nous pouvons vous aider à atteindre vos objectifs en IA.




