ARTFEED — Contemporary Art Intelligence

Potatura Adattiva dei Token in Due Fasi per Modelli Video-Linguaggio Efficienti

ai-technology · 2026-08-06

Un nuovo articolo di ricerca su arXiv (2608.03112v1) propone una strategia adattiva di potatura dei token in due fasi per ridurre la latenza di inferenza nei modelli visione-linguaggio (VLM) per la comprensione video. Il metodo affronta l'alto costo computazionale dell'elaborazione di migliaia di token per fotogramma, particolarmente problematico per la sorveglianza in tempo reale e i dispositivi edge. Le tecniche esistenti di riduzione dei token sono progettate per singole immagini e non sfruttano le ridondanze temporali tra i fotogrammi video. Inoltre, utilizzano un rapporto di potatura fisso, che è subottimale poiché la ridondanza varia tra i video. L'approccio proposto adatta i livelli di potatura in base al contenuto, con l'obiettivo di preservare le informazioni critiche migliorando l'efficienza. L'articolo è scritto da ricercatori ed è disponibile su arXiv, indicando un tipo di cross-listing. Questo lavoro contribuisce al campo dell'inferenza AI efficiente, con potenziali applicazioni nell'analisi video e nell'AI su dispositivo.

Fatti principali

  • Articolo arXiv:2608.03112v1
  • Propone una potatura adattiva dei token in due fasi
  • Si rivolge ai modelli video-linguaggio
  • Affronta l'elevata latenza di inferenza
  • I metodi esistenti falliscono sulle ridondanze temporali video
  • I rapporti di potatura fissi sono subottimali
  • Punta a una potatura dipendente dal contenuto
  • Rilevante per dispositivi edge e sorveglianza

Entità

Istituzioni

  • arXiv

Fonti