Ricerca

Sbloccare il potenziale dei vision language model sulle immagini satellitari tramite fine-tuning

August 1, 2025

By Mistral AI

Il fine-tuning dei foundation model sta trasformando il modo in cui applichiamo l’AI ai problemi reali. Adattando modelli preaddestrati a domini specifici, possiamo ottenere prestazioni nettamente migliori su attività specializzate. Oggi siamo lieti di condividere come il fine-tuning di Pixtral-12B su immagini satellitari porti a miglioramenti significativi rispetto al modello di base, dimostrando la potenza dell’adattamento specifico per dominio.

Il fine-tuning LoRA può adattare in modo efficiente i pesi del modello a task specifici

Il fine-tuning dei large language model può richiedere molte risorse, ma tecniche come Low-Rank Adaptation (LoRA) lo rendono molto più efficiente. LoRA funziona inserendo piccole matrici di decomposizione a basso rango addestrabili nei pesi del modello, consentendo un adattamento mirato senza modificare l’intero modello. Permette agli sviluppatori di adattare i modelli a task specifici, che si tratti di apprendere un vocabolario di dominio, adottare un tono particolare o integrare conoscenze specialistiche, senza riaddestrare l’intero modello.

Questo metodo dà il meglio quando il prompt engineering o gli esempi few-shot non sono sufficienti. I prompt complessi possono diventare intricati e difficili da mantenere, producendo spesso risultati incoerenti. Con il fine-tuning basato su LoRA, pochi esempi curati possono orientare il modello in modo più affidabile, ottenendo prestazioni migliori con meno overhead.

L’importanza dei modelli specializzati per le immagini satellitari

Le immagini satellitari rappresentano un dominio visivo altamente specializzato, con applicazioni critiche in tutta l’economia globale. Dal tracciamento della deforestazione e il monitoraggio dei cambiamenti ambientali al rilevamento di minacce emergenti, queste immagini alimentano decisioni ad alto impatto in ambito governativo, agricolo, della difesa e della scienza del clima. Per estrarre insight affidabili, i modelli devono essere finemente specializzati sui pattern e sulla semantica unici dei dati satellitari. È qui che entra in gioco il fine-tuning di Pixtral-12B, colmando il divario tra modelli di visione generalisti e competenze specifiche di dominio.

Caso di studio: classificazione di immagini satellitari dall’Aerial Image Dataset

Per dimostrare l’impatto del fine-tuning, abbiamo utilizzato l’Aerial Image Dataset (AID) introdotto da Xia et al con licenza Public Domain. Questo benchmark prevede la classificazione di immagini satellitari in categorie di scene dettagliate. Molte di queste classi (come dense residential rispetto a medium residential; oppure termini ambigui come center) sono difficili da gestire per i modelli vision-language generalisti senza contesto specifico di dominio. Il fine-tuning fornisce al modello questo contesto, consentendo una classificazione più accurata e sfumata.

1 Pixal 12b

Si noti che modelli di visione più piccoli e specializzati potrebbero potenzialmente raggiungere livelli di prestazioni comparabili. Questo articolo ha l’obiettivo di guidare il lettore nel processo di fine-tuning efficace del Vision Language Model (VLM) di Mistral tramite un esempio semplice e di dimostrarne l’impatto sulle metriche di classificazione di base. Applicazioni più avanzate del fine-tuning potrebbero includere interazioni come "parlare con un’immagine" o la generazione di didascalie per immagini.

Pixtral-12B senza fine-tuning ottiene risultati discreti, ma è carente sulle classi ambigue

Abbiamo iniziato con una configurazione di classificazione tradizionale, suddividendo il dataset in 8.000 campioni di training e 2.000 campioni di test. Utilizzando un system prompt che elencava tutte le classi target e imponeva un formato di output strutturato, abbiamo ottenuto risultati di baseline ragionevoli. Tuttavia, le prestazioni variavano in modo significativo tra le classi, soprattutto quelle con sottili distinzioni visive. Inoltre, poiché il language model non è vincolato esplicitamente al set di label, occasionalmente ha generato allucinazioni con nomi di classi inesistenti o non validi, evidenziando i limiti degli approcci basati esclusivamente su prompt.

System prompt di classificazione

Classificare la seguente immagine nella categoria a cui appartiene.

- Queste label di categoria sono Desert; BareLand; RailwayStation; Mountain; Parking; River; Church; MediumResidential; Commercial; Forest; Airport; Bridge; Park; Farmland; SparseResidential; BaseballField; School; Playground; Square; Stadium; Meadow; Beach; Resort; DenseResidential; Port; StorageTanks; Pond; Viaduct; Industrial; Center.

- Restituire il risultato utilizzando esclusivamente il seguente schema: {'image_description': FieldInfo(annotation=str, required=True), 'label': FieldInfo(annotation=str, required=True)}

- Inserire i risultati tra un tag json

```json ```

Confusion Matric

Alcune classi possono essere piuttosto difficili da distinguere senza conoscenze pregresse o criteri specifici. Ad esempio, si considerino le immagini qui sotto, che mostrano un "Playground" a sinistra e uno "Stadium" a destra. Il modello Pixtral di base le classifica entrambe come "Stadium". A un’analisi più attenta, la differenza principale è la presenza di posti a sedere attorno al campo sportivo. Prevediamo che il fine-tuning aiuterà a cogliere queste sfumature.

Stade Pixtral

Il fine-tuning del modello Mistral è semplicissimo con la nostra API e la UI di LaPlateforme

Per migliorare questi risultati, abbiamo sottoposto Pixtral-12B a fine-tuning utilizzando la API di fine-tuning di Mistral. La strategia di fine-tuning consisteva nel fornire la "assistant response" con la label corretta per un system prompt e un’immagine di input. Non è stato necessario un tuning esteso degli iperparametri, rendendo il processo efficiente e conveniente.

Un’altra opzione è avviare job di fine-tuning tramite LaPlateforme UI

3

Selezione degli iperparametri

Scegliere gli iperparametri corretti è fondamentale per un fine-tuning efficace. Ecco alcuni suggerimenti:

  • Learning rate: iniziare con un learning rate basso per evitare di superare i pesi ottimali.

  • Batch size: utilizzare un batch size compatibile con le proprie risorse computazionali, mantenendo gradienti stabili.

  • Epochs: iniziare con una singola epoca e monitorare le prestazioni. È possibile aggiungere ulteriori epoche se necessario, ma raccomandiamo di monitorare attentamente il rischio di overfitting.

Nota: le chiamate API dirette con l’API di fine-tuning di Mistral offrono maggiore controllo sugli iperparametri. Su LaPlateforme è sufficiente fornire il learning rate desiderato e il numero di epoche; il motore di fine-tuning calcolerà quindi il batch size ottimale in base alle dimensioni del dataset e ai benchmark interni sul numero ottimale di token per batch.

Il fine-tuning contribuisce ad aumentare le prestazioni del modello di 1,6 volte

4

Dopo il fine-tuning, abbiamo osservato un netto salto in avanti nelle metriche di classificazione per tutte le classi (ad esempio, l’accuracy complessiva è aumentata da 0,56 a 0,91). Le prestazioni del modello sono diventate più coerenti tra le classi e le allucinazioni si sono ridotte in modo significativo (dal 5% allo 0,1%). Sebbene i risultati non siano perfetti al 100%, il miglioramento è stato sostanziale, soprattutto considerando il budget limitato (≤10$) e il numero relativamente ridotto di campioni (8.000 distribuiti su 30 classi).

5

Conclusione

Il fine-tuning di Pixtral-12B su immagini satellitari dimostra l’efficacia di tecniche come LoRA per ottenere miglioramenti notevoli nelle prestazioni del modello. Questo approccio non è solo conveniente, ma anche scalabile, rendendolo ideale per un’ampia gamma di applicazioni. Esempi tipici includono dati altamente specializzati, spesso proprietari, sottorappresentati nei training set dei VLM tradizionali. Tra questi possono rientrare: captioning di immagini mediche, report dettagliati da immagini di sorveglianza, trascrizione di manoscritti antichi, ecc.

Per maggiori dettagli sull’implementazione, consulti il nostro cookbook: https://github.com/mistralai/cookbook/blob/main/mistral/fine_tune/pixtral_finetune_on_satellite_data.ipynb 

Contattaci

Interessato a un lavoro più personalizzato con il team di Mistral AI? Ci contatti per supporto sulle soluzioni e scopra come possiamo aiutarLa a raggiungere i Suoi obiettivi in ambito AI.