Il Metodo GOTS Riduce i Token Visivi nei VLM ad Alta Risoluzione
Un nuovo approccio noto come Greedy Orthogonal Token Selection (GOTS) elimina la necessità di addestramento riducendo al minimo il numero di token visivi nei modelli visione-linguaggio (VLM) ad alta risoluzione. I VLM contemporanei utilizzano una codifica visiva dinamica o ad alta risoluzione, producendo migliaia di token che aumentano i costi di inferenza. Le attuali tecniche di riduzione valutano l'utilità dei token in base a importanza, pertinenza, copertura, diversità o obiettivi a livello di sottoinsieme. Al contrario, GOTS si concentra sulla complementarità dello span selezionato, scegliendo il token con la più alta energia residua ortogonale al sottoinsieme attualmente mantenuto, ottimizzando così il determinante di Gram incrementale a un passo. Questo metodo è indipendente dalla query e non richiede alcun addestramento. La ricerca è disponibile su arXiv con ID 2607.23913.
Fatti principali
- GOTS è un metodo senza addestramento e indipendente dalla query per la riduzione dei token visivi.
- Seleziona i token basandosi sulla complementarità ortogonale rispetto al sottoinsieme mantenuto.
- Il metodo massimizza il determinante di Gram incrementale a un passo.
- I VLM moderni producono migliaia di token visivi, aumentando il costo di inferenza.
- I metodi esistenti utilizzano importanza per token, pertinenza alla query, copertura o diversità.
- L'articolo è pubblicato su arXiv con ID 2607.23913.
- GOTS non richiede addestramento o informazioni sulla query.
- L'approccio considera la riduzione dei token attraverso la complementarità dello span selezionato.
Entità
Istituzioni
- arXiv