ARTFEED — Contemporary Art Intelligence

SAM3D migliora la comprensione 3D nei modelli di manipolazione robotica

ai-technology · 2026-07-29

Un recente articolo di ricerca introduce un framework per allineare le rappresentazioni 3D incentrate sugli oggetti all'interno dei modelli Visione-Linguaggio-Azione (VLA), affrontando le loro carenze nella comprensione 3D dettagliata. Questo framework, basato su π0, utilizza SAM3D come istruttore 3D statico per fornire prior 3D dell'oggetto target durante il processo di addestramento. I modelli di riconoscimento identificano gli oggetti rilevanti per il compito, generano maschere degli oggetti e SAM3D produce rappresentazioni 3D dense degli oggetti che si allineano con le caratteristiche visive intermedie di π0. Di conseguenza, la politica può assimilare i dati 3D dell'oggetto target mantenendo il processo di inferenza originale RGB-linguaggio-azione, evitando la necessità di profondità, nuvole di punti, maschere, SAM3D o altri componenti 3D durante il test. L'articolo è disponibile su arXiv con ID 2607.25912.

Fatti principali

  • Propone l'allineamento delle rappresentazioni 3D incentrate sugli oggetti per i modelli VLA
  • Costruito su π0, utilizzando SAM3D come insegnante 3D congelato
  • Localizza gli oggetti rilevanti per il compito con modelli di riconoscimento
  • Genera maschere degli oggetti e estrae rappresentazioni 3D dense tramite SAM3D
  • Allinea le rappresentazioni 3D con le caratteristiche visive intermedie di π0
  • Preserva la pipeline di inferenza RGB-linguaggio-azione
  • Elimina la necessità di profondità, nuvole di punti, maschere o SAM3D al momento del test
  • Articolo disponibile su arXiv: 2607.25912

Entità

Istituzioni

  • arXiv

Fonti