WAM-Diff2: Distillazione Gerarchica da AR a Diffusione per una Guida Autonoma VLA Efficiente
Un nuovo framework, WAM-Diff2, mira a combinare le capacità cognitive dei modelli autoregressivi Visione-Linguaggio-Azione (VLA) con l'efficienza esecutiva delle politiche di diffusione per la guida autonoma. L'approccio affronta la sfida di trasformare generalisti autoregressivi pre-addestrati in modelli di diffusione paralleli, il che è difficile a causa di pattern di attenzione non corrispondenti e obiettivi di ottimizzazione divergenti. WAM-Diff2 è un framework VLA a diffusione discreta multi-task che impiega un processo di distillazione gerarchica in tre fasi per colmare questo divario. L'articolo, disponibile su arXiv (2608.01035), dettaglia l'architettura e la metodologia, evidenziando il potenziale per un'esecuzione parallela a bassa latenza mantenendo un ragionamento visivo-linguistico olistico. Il lavoro è significativo per la distribuzione di modelli VLA in sistemi di guida autonoma in tempo reale, dove la latenza computazionale e il bias di esposizione sono vincoli critici.
Fatti principali
- WAM-Diff2 è un framework VLA a diffusione discreta multi-task.
- Utilizza una distillazione gerarchica in tre fasi da AR a diffusione.
- Il framework combina modelli VLA autoregressivi con politiche di diffusione.
- Affronta la latenza computazionale e il bias di esposizione nella guida autonoma.
- L'articolo è disponibile su arXiv con ID 2608.01035.
- L'approccio mira a trasformare generalisti autoregressivi pre-addestrati in modelli di diffusione paralleli.
- Affronta le sfide dei pattern di attenzione non corrispondenti e degli obiettivi di ottimizzazione divergenti.
- Il framework è progettato per la guida autonoma end-to-end.
Entità
Istituzioni
- arXiv