A-PACK: Potatura Audio Differita per LLM Omni-Modali Efficienti
Uno studio recente presenta A-PACK, un approccio in due fasi progettato per comprimere sequenze multimodali all'interno di modelli linguistici di grandi dimensioni (LLM) omni-modali che gestiscono simultaneamente audio, video e testo. Questa tecnica mitiga le significative richieste computazionali associate a sequenze lunghe, posticipando la potatura audio fino a quando non emergono interazioni multimodali condizionate dalla query e utilizzando dinamiche audio-visive locali per facilitare la compressione video. Il framework mantiene i token audio mentre comprime il video prima dell'elaborazione LLM, successivamente potando i token audio e visivi a bassa rilevanza insieme alle loro voci di cache KV all'interno dell'LLM. I test condotti su Qwen2.5-Omni-7B e Qwen2.5-Omni-3B su quattro benchmark indicano che A-PACK offre le migliori prestazioni medie. L'articolo è disponibile su arXiv con l'identificatore 2608.08794.
Fatti principali
- A-PACK è un framework in due fasi per LLM omni-modali.
- Posticipa la potatura audio fino a quando emergono interazioni multimodali condizionate dalla query.
- L'audio ha una densità di informazioni rilevanti per il compito per token superiore rispetto al video.
- Le dinamiche audio-visive locali sono più efficaci per la selezione visiva rispetto al confronto token per token.
- Il video viene compresso prima dell'LLM, mentre l'audio viene preservato.
- La potatura progressiva dei token audio e visivi a bassa rilevanza e delle voci di cache KV avviene all'interno dell'LLM.
- Testato su Qwen2.5-Omni-7B e Qwen2.5-Omni-3B.
- Ottiene le migliori prestazioni medie su quattro benchmark.
- Identificatore dell'articolo: arXiv:2608.08794.
Entità
Istituzioni
- arXiv