Auto-JEPA: Modello del Mondo Latente per la Guida Autonoma End-to-End
Uno studio recente intitolato Auto-JEPA introduce un modello del mondo latente per la guida autonoma, enfatizzando la previsione delle intenzioni di guida future invece di ricostruire l'intero ambiente futuro. Dettagliato in arXiv:2607.29031, questo modello prioritizza le caratteristiche della scena che influenzano le azioni future dell'ego, utilizzando la previsione congiunta di embedding per sincronizzare un embedding di intenzione con la rappresentazione latente della traiettoria futura dell'ego. Recupera traiettorie azionabili da una memoria fissa, organizzate da un modulo di selezione condizionato dalla scena. In particolare, l'encoder visivo rimane invariato e il modello non richiede annotazioni di percezione esplicite o un generatore di traiettorie appreso, concentrandosi esclusivamente su obiettivi specifici del compito. Questo metodo si differenzia dai modelli del mondo tradizionali che si impegnano in previsioni video dense, stati di occupazione o movimenti degli agenti. L'articolo afferma che una pianificazione efficace dovrebbe concentrarsi su caratteristiche rilevanti piuttosto che ricostruire l'intero mondo futuro.
Fatti principali
- Auto-JEPA è un modello del mondo latente per la guida autonoma.
- Prevede l'intenzione di guida futura tramite la previsione congiunta di embedding.
- Il modello non ricostruisce l'intero mondo futuro.
- Utilizza un encoder visivo congelato e nessuna annotazione di percezione esplicita.
- Le traiettorie vengono recuperate da una memoria fissa e classificate da un modulo condizionato dalla scena.
- L'articolo è disponibile su arXiv con ID 2607.29031.
- L'approccio si concentra sulle caratteristiche della scena che influenzano l'azione futura dell'ego.
- Si contrappone a metodi di previsione densa come la previsione video o di occupazione.
Entità
Istituzioni
- arXiv