ARTFEED — Contemporary Art Intelligence

VQVLA: Co-Progettazione Algoritmo-Hardware per l'Inferenza Efficiente di VLA

ai-technology · 2026-07-29

I ricercatori propongono VQVLA, un framework di co-progettazione algoritmo-hardware per accelerare l'inferenza dei modelli Vision-Language-Action (VLA) su GPU. I modelli VLA, utilizzati nell'IA incarnata, soffrono di elevata latenza. VQVLA introduce MotionVQ, uno schema di quantizzazione vettoriale sensibile al movimento che regola la precisione in base allo stato di esecuzione del robot, riducendo l'accesso alla memoria pur preservando il successo del compito. Propone inoltre un paradigma GEMM vettorizzato a centroidi fusi che elimina le moltiplicazioni ridondanti tramite aggregazione spaziale e riutilizzo temporale dei centroidi. Il framework mira alla ridondanza in memoria e calcolo non sfruttata da acceleratori esistenti come Dadu-Corki.

Fatti principali

  • VQVLA è un framework di co-progettazione algoritmo-hardware per l'accelerazione dell'inferenza VLA.
  • MotionVQ è uno schema di quantizzazione vettoriale sensibile al movimento.
  • MotionVQ regola la precisione di quantizzazione in base allo stato di esecuzione del robot.
  • Il paradigma GEMM vettorizzato a centroidi fusi opera sulla rappresentazione indice-codebook.
  • Elimina le moltiplicazioni ridondanti tramite aggregazione spaziale e riutilizzo temporale dei centroidi.
  • Acceleratori esistenti come Dadu-Corki trattano i modelli VLA come carichi di lavoro a piena precisione.
  • I modelli VLA hanno un'elevata latenza di inferenza sulle GPU.
  • Il framework riduce l'accesso alla memoria preservando il tasso di successo del compito.

Entità

Fonti