VTM-Nav: Navigazione verso oggetti tra episodi con memoria visivo-topologica
Un nuovo framework chiamato VTM-Nav è stato introdotto dai ricercatori per la navigazione verso oggetti tra episodi senza richiedere addestramento. Questo sistema impiega una Memoria Visivo-Topologica Gerarchica (VTM) che conserva le informazioni della scena attraverso diversi episodi senza necessità di riaddestramento. VTM organizza le memorie visive in base a layout di base delle stanze, distingue tra dati all'interno della stanza e visibili a distanza, e mantiene indizi per approcci di successo. Quando si presenta un nuovo compito, VTM-Nav ri-localizza l'agente all'interno della struttura della scena accumulata, recupera record rilevanti da stanze probabili e utilizza la guida della memoria per informare i candidati attuali. Questo studio affronta il problema degli agenti ObjectNav senza addestramento, che spesso perdono la conoscenza della scena acquisita in precedenza dopo ogni compito. VTM-Nav funziona con componenti di navigazione fissi e parametri del modello, sfruttando le esperienze tra episodi senza fare affidamento su dati oracle.
Fatti principali
- VTM-Nav è un framework senza addestramento per ObjectNav tra episodi
- Utilizza una Memoria Visivo-Topologica Gerarchica (VTM)
- VTM indicizza le memorie visive per topologia grossolana delle stanze
- Distingue le prove all'interno della stanza da quelle visibili a distanza
- Conserva indizi di approccio di successo tra episodi
- Ri-localizza l'agente nella struttura della scena accumulata
- Recupera record rilevanti per l'obiettivo da stanze plausibili
- Opera con parametri del modello fissi e senza riaddestramento
Entità
—