ARTFEED — Contemporary Art Intelligence

FlashDrive: Un Framework di Co-Design per l'Inferenza VLA in Tempo Reale nella Guida Autonoma

ai-technology · 2026-08-15

Un nuovo articolo su arXiv (2608.12932) introduce FlashDrive, un framework di co-design algoritmo-sistema volto a ridurre il costo computazionale dei modelli Visione-Linguaggio-Azione (VLA) per la guida autonoma. Gli autori identificano quattro colli di bottiglia strutturali nell'inferenza VLA: spreco di codifica visiva su frame sovrapposti, ricalcolo del prefill del modello linguistico, generazione seriale di token di ragionamento a bassa entropia e calcolo uniforme nel denoising flow-matching. FlashDrive affronta tutte e quattro le fasi simultaneamente, sfruttando la sovrapposizione temporale per il riutilizzo della cache KV in streaming, la bassa entropia per token e le scorciatoie intra-blocco. L'articolo è categorizzato come 'nuovo' su arXiv ed è disponibile all'URL fornito. Il framework promette di rendere il ragionamento end-to-end fattibile per il controllo in tempo reale nei veicoli autonomi.

Fatti principali

  • FlashDrive è un framework di co-design algoritmo-sistema per modelli VLA nella guida autonoma.
  • L'inferenza VLA presenta quattro colli di bottiglia strutturali: codifica visiva, prefill del modello linguistico, generazione di token di ragionamento e denoising flow-matching.
  • FlashDrive affronta tutti e quattro i colli di bottiglia simultaneamente.
  • Intuizione chiave: la sovrapposizione temporale consente il riutilizzo della cache KV in streaming tra i frame.
  • La bassa entropia per token e la forte struttura intra-blocco consentono scorciatoie algoritmiche leggere.
  • L'articolo è annunciato come 'nuovo' su arXiv con ID 2608.12932.
  • L'articolo è disponibile su https://arxiv.org/abs/2608.12932.
  • L'obiettivo è ridurre il costo computazionale per il controllo in tempo reale nella guida autonoma.

Entità

Istituzioni

  • arXiv

Fonti