VoxZip: Compressione della Cache KV con Ancoraggio Semantico per l'Inferenza Audio a Contesto Lungo
Uno studio recente pubblicato su arXiv (2608.08569) presenta VoxZip, un framework a due fasi che opera senza addestramento per comprimere le cache key-value (KV) nei modelli linguistici vocali (Speech LLM), facilitando un'inferenza efficiente per audio a contesto lungo. La fase iniziale utilizza trascrizioni di riconoscimento vocale automatico (ASR) come ancore semantiche per allineare, comprimere e fondere i token audio, riducendo così la dimensione della cache KV e aumentando la densità informativa dei token. La fase successiva implementa una tecnica di filtraggio dinamico che si basa sull'attenzione accumulata con decadimento temporale per rimuovere i token non essenziali, riducendo il bias dei token iniziali. Questo approccio affronta la sfida degli elevati requisiti di memoria della cache KV nelle attività audio a contesto lungo, che i metodi di compressione tradizionali incentrati sul testo non riescono a gestire a causa di interruzioni nella continuità del discorso o perdita di informazioni semantiche. Gli autori dell'articolo sono ricercatori che hanno condiviso i loro risultati su arXiv, una piattaforma di preprint, indicando che non è ancora stato sottoposto a revisione paritaria. Questa ricerca è cruciale per migliorare l'applicabilità dei modelli linguistici vocali in scenari reali che richiedono contesti audio lunghi, tra cui trascrizione di riunioni, sintesi audio e tecnologie di assistente vocale.
Fatti principali
- VoxZip è un framework di compressione della cache KV con ancoraggio semantico, a due fasi e senza addestramento.
- La prima fase utilizza trascrizioni ASR come ancore semantiche per allineare, comprimere e fondere i token audio.
- La seconda fase utilizza una strategia di filtraggio dinamico basata sull'attenzione accumulata con decadimento temporale.
- Il metodo riduce la cache KV iniziale e aumenta la densità informativa dei token.
- Mitiga il bias dei token iniziali nell'evizione dei token.
- L'articolo è disponibile su arXiv con ID 2608.08569.
- Il lavoro mira all'inferenza audio a contesto lungo nei modelli linguistici vocali.
- I metodi di compressione esistenti incentrati sul testo sono inefficaci per l'audio a causa della continuità del discorso e della perdita di segnali semantici.
Entità
Istituzioni
- arXiv