Dataset Sintetico per il Ragionamento Spaziale dei Robot tramite Modelli Visione-Linguaggio
Un nuovo articolo di ricerca presenta un framework volto ad addestrare Modelli Visione-Linguaggio (VLM) per eseguire il Visual Perspective Taking (VPT), un'abilità essenziale per la cognizione incarnata nell'Interazione Uomo-Robot (HRI). Gli autori hanno sviluppato un dataset sintetico utilizzando NVIDIA Omniverse, progettato per l'apprendimento supervisionato in compiti di ragionamento spaziale. Ogni elemento del dataset consiste in un'immagine RGB, una descrizione in linguaggio naturale corrispondente e una matrice di trasformazione 4x4 ground-truth che indica la posa dell'oggetto. Inizialmente, l'enfasi è sulla determinazione della distanza sull'asse Z, con piani futuri per incorporare il ragionamento completo a 6 Gradi di Libertà (DOF). Questo dataset è reso pubblicamente accessibile per incoraggiare ulteriori esplorazioni nell'IA incarnata per applicazioni interattive uomo-robot.
Fatti principali
- Il framework addestra VLM per il Visual Perspective Taking (VPT)
- Dataset sintetico generato in NVIDIA Omniverse
- Ogni istanza include immagine RGB, descrizione in linguaggio naturale e matrice di trasformazione 4x4
- Focus iniziale sull'inferenza della distanza sull'asse Z
- Estensioni future mirano al ragionamento completo a 6 Gradi di Libertà (DOF)
- Il dataset è disponibile pubblicamente
- Il lavoro è un passo fondamentale verso l'IA incarnata per HRI
- Pubblicato su arXiv sotto Computer Science > Artificial Intelligence
Entità
Istituzioni
- NVIDIA Omniverse
- arXiv