Previsione di Fallimento OpenVLA: Le Attivazioni Interne Segnalano Errori Imminenti Sotto Cambiamento Visivo
Un preprint arXiv (2606.29699) esplora il potenziale delle attivazioni interne in OpenVLA, un modello che integra visione, linguaggio e azione, per prevedere fallimenti derivanti da cambiamenti nella distribuzione visiva. La ricerca mantiene una politica fissa e cattura un'attivazione MLP per ogni passo all'interno del benchmark LIBERO-10. Il successo del compito diminuisce significativamente dal 57% al 17% a causa dell'occlusione. Nel contesto di traiettorie matched-reset fallite, una sonda logistica che analizza le attivazioni del layer 16 produce un AUROC di 0,972 e un AUPRC di 0,352, mentre il disaccordo di azione raggiunge solo un AUROC di 0,496. La sonda addestrata su occlusione, senza riadattamento, ottiene un AUROC di 0,689 su episodi falliti di jitter della fotocamera. Nonostante una forte discriminazione retrospettiva, il monitor del layer 16 registra in media 3,32 insorgenze di avviso per episodio pulito, rivelando sfide per sistemi pratici di allarme precoce. Questo studio, scritto da ricercatori, è stato pubblicato su arXiv il 26 giugno 2026.
Fatti principali
- OpenVLA è una politica visione-linguaggio-azione.
- I cambiamenti visivi possono causare il fallimento di OpenVLA dopo un comportamento inizialmente plausibile.
- Lo studio utilizza il benchmark LIBERO-10.
- L'occlusione riduce il successo del compito dal 57% al 17%.
- La sonda logistica del layer 16 raggiunge un AUROC di 0,972 e un AUPRC di 0,352 su traiettorie matched-reset fallite.
- Il disaccordo di azione raggiunge un AUROC di 0,496 sulle stesse traiettorie.
- La sonda addestrata su occlusione raggiunge un AUROC di 0,689 su episodi falliti di jitter della fotocamera senza riadattamento.
- Il monitor del layer 16 registra in media 3,32 insorgenze di avviso per episodio pulito nel controllo di calibrazione.
Entità
Istituzioni
- arXiv