ARTFEED — Contemporary Art Intelligence

GUARD: Rilevamento di Errori al Momento del Test per Politiche Visione-Linguaggio-Azione Basate su Diffusione

ai-technology · 2026-08-06

È stato sviluppato un nuovo metodo chiamato GUARD per migliorare il test delle politiche visione-linguaggio-azione (VLA) basate su diffusione, che sono in grado di produrre azioni plausibili nonostante deboli connessioni con i segnali visivi e linguistici necessari. GUARD analizza meticolosamente il radicamento di queste azioni mantenendo la politica pre-addestrata originale. Valuta i singoli componenti nella cache chiave-valore (KV) del modello, genera cache alternative e ispeziona le variazioni nelle uscite di denoising. Inoltre, GUARD offre approfondimenti diagnostici come sensibilità ed entropia dell'attenzione. Questa tecnica innovativa è stata testata su cinque scenari di benchmark di politiche, con risultati disponibili su arXiv con ID 2608.04510.

Fatti principali

  • GUARD è un metodo di rilevamento degli errori al momento del test per politiche VLA basate su diffusione.
  • Misura il radicamento senza modificare la politica pre-addestrata.
  • Utilizza la cache chiave-valore (KV) del modello visione-linguaggio finale.
  • Costruisce cache controfattuali eliminando le voci KV salienti.
  • Confronta le risposte di denoising con il condizionamento originale.
  • Deriva un flusso diagnostico che include sensibilità, entropia dell'attenzione, bias di modalità ed efficienza di radicamento.
  • Il flusso diagnostico viene calibrato online e processato da un classificatore temporale leggero.
  • La valutazione ha utilizzato Pi0, SmolVLA e Alpamayo-1.5 su LIBERO, SimplerEnv, MetaWorld e Physic.

Entità

Istituzioni

  • arXiv

Fonti