ARTFEED — Contemporary Art Intelligence

OmniDelta: Compressione dei Token Guidata dalle Competenze per OmniLLM

other · 2026-07-29

Un nuovo articolo su arXiv (2607.25669) introduce OmniDelta, un framework senza addestramento per la compressione dei token nei Modelli Linguistici di Grandi Dimensioni Omni-modali (OmniLLM). Gli OmniLLM elaborano testo, audio e video, ma lunghe sequenze di token causano costi elevati di memoria e inferenza. I metodi esistenti selezionano token importanti sotto budget fissi, trascurando l'allocazione del budget. OmniDelta affronta questo problema con un'allocazione inter-modale guidata dalle competenze e consapevole dell'intento, e un'allocazione intra-modale basata sul contenuto. Costruisce pool di competenze audio e video per spostare i budget di token mantenuti in base alla domanda della query, quindi rialloca i budget su segmenti audio e fotogrammi video utilizzando la complessità locale. L'articolo mostra che la similarità diretta query-audio/video è inaffidabile per l'allocazione del budget, e che budget intra-modali uniformi possono perdere prove chiave. OmniDelta è senza addestramento e mira a migliorare l'efficienza.

Fatti principali

  • 1. L'articolo arXiv:2607.25669 propone OmniDelta per la compressione dei token negli OmniLLM.
  • 2. OmniDelta è un framework senza addestramento e guidato dalle competenze.
  • 3. Combina allocazione inter-modale consapevole dell'intento con allocazione intra-modale basata sul contenuto.
  • 4. Costruisce pool di competenze audio e video per spostare i budget di token mantenuti.
  • 5. I budget vengono riallocati su segmenti audio e fotogrammi video utilizzando la complessità locale.
  • 6. La similarità diretta query-audio/video è inaffidabile per l'allocazione inter-modale del budget.
  • 7. Budget intra-modali uniformi possono perdere prove chiave mantenendo contenuti ridondanti.
  • 8. L'articolo affronta il problema poco esplorato dell'allocazione del budget nella compressione dei token.

Entità

Istituzioni

  • arXiv

Fonti