Predire l'attenzione dei livelli intermedi nei MLLM per un'efficiente potatura dei token visivi
Un nuovo articolo arXiv (2608.06411) affronta i colli di bottiglia di efficienza nei modelli linguistici multimodali di grandi dimensioni (MLLM) causati dall'elaborazione di numerosi token visivi. Gli autori propongono un metodo per prevedere l'attenzione dei livelli intermedi, utilizzata per guidare la potatura dei token visivi. La loro analisi rivela che il livello ottimale per l'attenzione varia tra i campioni, rendendo la selezione a livello fisso subottimale. Inoltre, ottenere l'attenzione dal livello intermedio appropriato richiede l'elaborazione di molti token visivi attraverso diversi livelli, comportando un costo computazionale significativo. L'approccio proposto mira a prevedere l'attenzione dal livello più reattivo senza elaborazione completa, riducendo così il costo computazionale. L'articolo è annunciato come una nuova sottomissione ed è disponibile su arXiv.
Fatti principali
- ID articolo: arXiv:2608.06411
- Tipo di annuncio: nuovo
- Focus: efficienza dei modelli linguistici multimodali di grandi dimensioni (MLLM)
- Problema: l'elaborazione di numerosi token visivi è costosa
- Soluzione: potatura dei token visivi guidata dall'attenzione testo-visione dai livelli intermedi
- Problema: il livello ottimale varia tra i campioni, il livello fisso è subottimale
- Problema: ottenere l'attenzione dei livelli intermedi richiede l'elaborazione di molti token attraverso diversi livelli
- Proposta: prevedere l'attenzione dei livelli intermedi per evitare l'elaborazione completa
Entità
Istituzioni
- arXiv