ARTFEED — Contemporary Art Intelligence

CoverPrune: Potatura dei Token Basata sul Trasporto Ottimale per i 3D VLM

ai-technology · 2026-08-15

Un recente articolo pubblicato su arXiv (2608.13226) presenta CoverPrune, un nuovo framework per la potatura dei token nei modelli di linguaggio visivo 3D (3D VLM) che non richiede addestramento. Questo approccio affronta il problema dell'elevato numero di token visivi che ostacolano le prestazioni durante l'inferenza. Le tecniche tradizionali di potatura dei token spesso privilegiano la diversità, portando all'eliminazione di token prototipo chiave a favore di valori anomali, il che interrompe le consistenze multi-vista e le strutture geometriche vitali per un efficace ragionamento spaziale. CoverPrune sposta l'attenzione dalla massimizzazione della diversità al mantenimento della copertura delle prove visive, inquadrando la potatura dei token durante l'inferenza come un problema di Trasporto Ottimale (OT) e introducendo un meccanismo Feature-Spaziale-Temporale (FST) per affrontare la complessa sfida della selezione dei sottoinsiemi. La ricerca, significativa per migliorare l'efficienza dei 3D VLM nei compiti di ragionamento spaziale, è attribuita a un team di ricercatori.

Fatti principali

  • CoverPrune è un framework senza addestramento per la potatura dei token nei 3D VLM.
  • Formula la potatura dei token come un problema di Trasporto Ottimale (OT).
  • I metodi di potatura basati sulla diversità esistenti scartano i token prototipo rappresentativi.
  • CoverPrune mira a preservare la copertura delle prove visive.
  • Il metodo utilizza un meccanismo Feature-Spaziale-Temporale (FST).
  • L'articolo è disponibile su arXiv con ID 2608.13226.
  • Il tipo di annuncio è cross.
  • Il lavoro affronta i colli di bottiglia computazionali nei 3D VLM.

Entità

Istituzioni

  • arXiv

Fonti