Introducing
Robostral Navigate

Summary

Robostral Navigate è un modello 8B che consente ai robot di navigare autonomamente in ambienti complessi utilizzando una sola telecamera RGB, raggiungendo il 76,6% di successo su benchmark R2R-CE unseen e superando gli approcci multi-sensore con maggiore efficienza. Sviluppato interamente internamente con dati simulati e tecniche efficienti in termini di token, generalizza tra tipi di robot e si adatta a ostacoli reali non visti durante l'addestramento. Il modello combina navigazione basata su pointing e reinforcement learning per un miglioramento continuo, aprendo la strada a un'AI embodied unificata nella robotica.

Oggi presentiamo Robostral Navigate, il nostro primo modello sviluppato per la navigazione embodied. È un modello 8B che riceve immagini RGB e un'istruzione in linguaggio naturale, e guida un robot attraverso un ambiente:

“Esci dalla lobby, percorri il corridoio, entra nel magazzino e fermati rivolto verso il secondo scaffale.”

Per svolgere compiti di questo tipo, altri modelli spesso utilizzano sensori di profondità, LiDAR o più telecamere che operano insieme. Robostral Navigate utilizza una sola telecamera RGB ordinaria e nessun sensore di profondità, eppure raggiunge comunque il 76,6% su R2R-CE (Room-to-Room in Continuous Environments) validation unseen, il benchmark per seguire istruzioni in ambienti esclusi dall'addestramento. Di conseguenza, supera di 9,7 punti il miglior approccio a telecamera singola e di 4,5 punti il miglior sistema che utilizza profondità o più telecamere, pur non usando né l'una né le altre.

Navigazione

Il nostro modello è progettato per la navigazione robotica, consentendo ai robot di muoversi autonomamente in ambienti complessi, tra cui uffici, edifici residenziali e commerciali e spazi esterni.

Robostral Navigate opera in modo completamente autonomo lungo un percorso con istruzione a lungo orizzonte all'interno di un ufficio operativo.

Questa tecnologia abilita numerose applicazioni nei settori manifatturiero, delle consegne, della logistica e dell'ospitalità, rendendola oggi una delle capacità più richieste dai nostri clienti. Basta dare a Robostral Navigate un'istruzione e completa l'intero compito autonomamente, muovendosi in uno spazio reale pieno di persone e ostacoli mai visti prima, con la capacità di adattarsi a qualsiasi contesto.

Punti salienti

  • Prestazioni allo stato dell'arte su R2R-CE

    • Tasso di successo del 79,4% sul set di validazione seen

    • Tasso di successo del 76,6% sul set di validazione unseen

  • Opera con una singola telecamera RGB, senza LiDAR né sensori di profondità

  • Modello 8B, sviluppato internamente e addestrato interamente in simulazione

  • Funziona su robot a ruote, con gambe e volanti, e generalizza tra robot di diverse dimensioni

  • Robusto rispetto alle differenze nei parametri intrinseci della telecamera

  • Addestramento efficiente in termini di token tramite prefix-caching

Navigazione tramite pointing

Dato un compito e una cronologia di osservazioni, Robostral Navigate predice dove il robot debba muoversi successivamente tramite pointing: inferisce le coordinate dell'immagine della posizione target nella vista attuale della telecamera del robot, insieme all'orientamento desiderato all'arrivo. A differenza dei comandi basati su spostamenti metrici, il pointing rende la policy naturalmente robusta ai cambiamenti nei parametri intrinseci della telecamera e nella scala del mondo.

Tuttavia, questo metodo non può gestire i casi in cui la posizione target si trova fuori dal campo visivo corrente. Quando il pointing non è applicabile, il modello ripiega sugli spostamenti nel sistema di coordinate locale del robot, ad esempio:

"Avanza di 2 metri, spostati di 1,5 metri a sinistra e ruota di 25 gradi a sinistra."

Sviluppato dalle fondamenta

Robostral Navigate è sviluppato interamente internamente e non si basa su VLM open-source esistenti.

Il modello è inizializzato a partire dal nostro modello vision-language specializzato in attività di grounding come pointing, conteggio e localizzazione degli oggetti. La navigazione emerge come estensione naturale di queste capacità: una volta compreso dove si trovano le cose, impara come muoversi.

Abbiamo costruito una pipeline efficiente di generazione dei dati interamente in simulazione. Questo ha consentito un'iterazione rapida sui dati, producendo un dataset di circa 2,4 milioni di traiettorie raccolte in 350.000 scene.

Addestramento supervisionato efficiente

Un ingrediente chiave di Robostral Navigate è un algoritmo di addestramento efficiente basato su prefix-caching. Utilizzando una strategia di attention-masking basata su alberi, il nostro metodo comprime un intero episodio in un'unica sequenza, consentendo l'addestramento su tutti gli step temporali in un solo forward pass e prevenendo al contempo la fuoriuscita di informazioni tra step temporali.

Rispetto all'addestramento con un campione per ogni step temporale, il nostro approccio riduce il numero di token di addestramento di 22× preservando tutti i segnali di apprendimento. In pratica, questo metodo trasforma run di addestramento che richiederebbero mesi in run completati in pochi giorni.

Reinforcement learning online

Sfruttiamo la nostra esperienza nel post-training di LLM su larga scala, utilizzando il reinforcement learning online, per migliorare le prestazioni di Robostral Navigate. Dopo la fase di addestramento supervisionato, miglioriamo ulteriormente le prestazioni del modello usando CISPO, un algoritmo di reinforcement learning online. Questo consente al modello di apprendere per tentativi ed errori, recuperare dagli insuccessi e acquisire comportamenti esplorativi, mitigando efficacemente il problema del distribution shift della behavior cloning standard. Da solo, questo ha migliorato il tasso di successo del 3,2%. Non osserviamo alcun plateau, quindi siamo convinti che ulteriore addestramento e ulteriori esperimenti continueranno ad aumentare questo valore.

Prossimi passi

Robostral Navigate è solo il primo passo verso un agente embodied unificato.

Riteniamo che la navigazione sia una capacità fondamentale per la robotica general-purpose. Combinando simulazione su larga scala, addestramento efficiente e forti prior di grounding, Robostral Navigate dimostra che una navigazione embodied allo stato dell'arte può essere ottenuta con un modello compatto e una singola telecamera RGB.

Inizi il suo percorso verso l'AI embodied all'avanguardia, parli con il nostro team.

A proposito, stiamo assumendo.

Il rilascio dei nostri modelli di navigazione segna un importante passo avanti, ma il nostro percorso è tutt'altro che concluso. La nostra ambizione è consentire ai robot di navigare autonomamente in ambienti complessi — uffici, case, edifici commerciali e spazi esterni — e resta ancora molto lavoro da fare. Stiamo ampliando attivamente il nostro team di robotica e cerchiamo ricercatori e ingegneri di talento che condividano la nostra ambizione.

Se le interessa unirsi alla nostra missione per portare una navigazione fluida ai robot ovunque, saremo lieti di ricevere la sua candidatura per entrare nel nostro team

Di Théo Cachet, Arjun Majumdar, Srijan Mishra, Thomas Chabal, Chris Bamford, Elliot Chane-Sane, Benjamin Tibi, Ludovic Ho Fuh, Olivier Duchenne - AI Science Robotics

Report tecnico

Legga il report tecnico di Robostral Navigate per l'architettura completa, la configurazione di addestramento e i risultati dei benchmark.