OmniDelta: Compressione dei Token Guidata dalle Competenze per OmniLLM
Un nuovo articolo su arXiv (2607.25669) introduce OmniDelta, un framework senza addestramento per la compressione dei token nei Modelli Linguistici di Grandi Dimensioni Omni-modali (OmniLLM). Gli OmniLLM elaborano testo, audio e video, ma lunghe sequenze di token causano costi elevati di memoria e inferenza. I metodi esistenti selezionano token importanti sotto budget fissi, trascurando l'allocazione del budget. OmniDelta affronta questo problema con un'allocazione inter-modale guidata dalle competenze e consapevole dell'intento, e un'allocazione intra-modale basata sul contenuto. Costruisce pool di competenze audio e video per spostare i budget di token mantenuti in base alla domanda della query, quindi rialloca i budget su segmenti audio e fotogrammi video utilizzando la complessità locale. L'articolo mostra che la similarità diretta query-audio/video è inaffidabile per l'allocazione del budget, e che budget intra-modali uniformi possono perdere prove chiave. OmniDelta è senza addestramento e mira a migliorare l'efficienza.
Fatti principali
- 1. L'articolo arXiv:2607.25669 propone OmniDelta per la compressione dei token negli OmniLLM.
- 2. OmniDelta è un framework senza addestramento e guidato dalle competenze.
- 3. Combina allocazione inter-modale consapevole dell'intento con allocazione intra-modale basata sul contenuto.
- 4. Costruisce pool di competenze audio e video per spostare i budget di token mantenuti.
- 5. I budget vengono riallocati su segmenti audio e fotogrammi video utilizzando la complessità locale.
- 6. La similarità diretta query-audio/video è inaffidabile per l'allocazione inter-modale del budget.
- 7. Budget intra-modali uniformi possono perdere prove chiave mantenendo contenuti ridondanti.
- 8. L'articolo affronta il problema poco esplorato dell'allocazione del budget nella compressione dei token.
Entità
Istituzioni
- arXiv