WNM-3D: Modello Generativo di Navigazione Mondiale con Condizionamento della Scena 3D per la Navigazione Visione-Linguaggio
Un nuovo modello chiamato WNM-3D è stato sviluppato da ricercatori per la navigazione continua visione-linguaggio (VLN). Questo modello generativo di navigazione mondiale affronta le carenze dei sistemi VLN esistenti che convertono modelli pre-addestrati visione-linguaggio (VLM) in politiche visione-azione-linguaggio (VLA), che collegano direttamente osservazioni egocentriche e comandi linguistici ad azioni di navigazione. Sebbene l'addestramento focalizzato sull'azione sia semanticamente efficace, non riesce a rappresentare accuratamente come gli input visivi di un agente dovrebbero cambiare in base ai suoi movimenti previsti. I modelli generativi mondo-azione (WAM) prevedono sia osservazioni future che azioni, ma gli attuali WAM per la VLN continua non utilizzano rappresentazioni geometriche derivate da osservazioni passate per la generazione congiunta di vista futura e azione. WNM-3D utilizza un encoder geometrico feed-forward congelato per creare un contesto di scena coerente dalla storia RGB egocentrica monoculare. Questo modello è discusso in un articolo su arXiv, identificato come 2608.07267, che evidenzia l'importanza del condizionamento della scena 3D per migliori risultati di navigazione.
Fatti principali
- WNM-3D è un modello generativo di navigazione mondiale per la navigazione continua visione-linguaggio.
- Utilizza un encoder geometrico feed-forward congelato per estrarre rappresentazioni geometriche dalla storia RGB egocentrica monoculare.
- Il modello condiziona la generazione congiunta di vista futura e azione su rappresentazioni geometriche.
- Affronta le limitazioni dei sistemi VLN esistenti che adattano i VLM in politiche VLA.
- Gli attuali WAM per la VLN continua non condizionano su rappresentazioni geometriche.
- L'articolo è annunciato su arXiv con identificatore 2608.07267.
- Il tipo di annuncio è 'nuovo'.
- Il modello consolida osservazioni passate in un contesto di scena persistente.
Entità
Istituzioni
- arXiv