CloudEdgeVLA: Nuovo framework per il controllo robotico cloud-edge
Il framework CloudEdgeVLA, recentemente introdotto, affronta il problema dell'implementazione di modelli Visione-Linguaggio-Azione (VLA) con miliardi di parametri in robot mobili, che devono bilanciare la necessità di ragionamento semantico basato su cloud con la richiesta di controllo locale a bassa latenza. Questo sistema innovativo considera il disallineamento temporale come una sfida nell'apprendimento di rappresentazioni, dove un VLA cloud elabora osservazioni ritardate in caratteristiche di task che cambiano gradualmente. Simultaneamente, una testa edge semplificata fonde le ultime caratteristiche cloud con la visione locale in tempo reale. Per l'addestramento, il modello associa i frame correnti a quelli ritardati casualmente, puntando alla stessa azione sia nei percorsi freschi che in quelli obsoleti, promuovendo la conservazione delle informazioni a livello di task nella rappresentazione cloud mentre il percorso edge fornisce reazioni tempestive. Il documento completo è disponibile su arXiv con l'identificatore 2608.00569.
Fatti principali
- CloudEdgeVLA è una policy cloud-edge per modelli VLA.
- Affronta il ritardo di rete e la variazione di latenza nel controllo di robot mobili.
- Il VLA cloud codifica osservazioni ritardate in caratteristiche di task.
- Una testa edge leggera combina le caratteristiche cloud con la visione locale.
- L'addestramento associa frame correnti e ritardati con lo stesso obiettivo di azione.
- L'approccio tratta il disallineamento temporale come un problema di apprendimento di rappresentazioni.
- Il documento è su arXiv con ID 2608.00569.
Entità
Istituzioni
- arXiv