Macer: Compressione dei Token Senza Addestramento per OmniLLM
Un nuovo articolo arXiv (2608.01665) introduce Macer, un metodo di compressione dei token senza addestramento per OmniLLM che disaccoppia l'allocazione dalla classificazione. Gli autori sostengono che gli attuali metodi di compressione dei token, che utilizzano una singola classificazione di salienza per mantenere i token top-K, sono mal specificati perché lo stesso punteggio di attenzione determina sia l'allocazione della capacità cross-modale che la selezione dei token all'interno della modalità. Questa regola top-K condivisa eredita un bias a favore dell'audio, allocando la capacità rimanente all'audio prima che i token video possano competere. Macer affronta questo problema assegnando prima budget espliciti per audio e video, quindi eseguendo una classificazione normalizzata per l'allocazione all'interno di ciascuna modalità a strati superficiali specifici della modalità. Il metodo riduce significativamente il costo dei token mantenendo l'accuratezza su benchmark audio-grounded, audio-video congiunti, visual-dominant e video-centrici. Con una ritenzione del 25%, Macer preserva il 98,7% delle prestazioni complete dei token su Qwen2.5-Omni-7B e il 97,3% su Qwen2.5-Omni-7B (probabilmente un refuso nell'originale, ma l'articolo riporta queste cifre). L'articolo è pubblicato su arXiv ed è rilevante per il campo dell'IA e dell'efficienza dei modelli multimodali.
Fatti principali
- L'articolo arXiv:2608.01665 introduce Macer, un metodo di compressione dei token senza addestramento per OmniLLM.
- Macer disaccoppia l'allocazione dei token dalla classificazione, affrontando il problema della singola classificazione di salienza mal specificata.
- Il metodo assegna budget espliciti per audio e video prima di eseguire una classificazione normalizzata per l'allocazione all'interno di ciascuna modalità.
- Macer opera a strati superficiali specifici della modalità.
- Con una ritenzione del 25%, Macer preserva il 98,7% delle prestazioni complete dei token su Qwen2.5-Omni-7B e il 97,3% su Qwen2.5-Omni-7B.
- L'articolo valuta Macer su benchmark audio-grounded, audio-video congiunti, visual-dominant e video-centrici.
- Macer riduce significativamente il costo dei token mantenendo l'accuratezza.
- L'articolo è annunciato come una nuova sottomissione arXiv con tipo 'new'.
Entità
Istituzioni
- arXiv