ARTFEED — Contemporary Art Intelligence

A-PACK: Potatura Audio Differita per LLM Omni-Modali Efficienti

ai-technology · 2026-08-11

Uno studio recente presenta A-PACK, un approccio in due fasi progettato per comprimere sequenze multimodali all'interno di modelli linguistici di grandi dimensioni (LLM) omni-modali che gestiscono simultaneamente audio, video e testo. Questa tecnica mitiga le significative richieste computazionali associate a sequenze lunghe, posticipando la potatura audio fino a quando non emergono interazioni multimodali condizionate dalla query e utilizzando dinamiche audio-visive locali per facilitare la compressione video. Il framework mantiene i token audio mentre comprime il video prima dell'elaborazione LLM, successivamente potando i token audio e visivi a bassa rilevanza insieme alle loro voci di cache KV all'interno dell'LLM. I test condotti su Qwen2.5-Omni-7B e Qwen2.5-Omni-3B su quattro benchmark indicano che A-PACK offre le migliori prestazioni medie. L'articolo è disponibile su arXiv con l'identificatore 2608.08794.

Fatti principali

  • A-PACK è un framework in due fasi per LLM omni-modali.
  • Posticipa la potatura audio fino a quando emergono interazioni multimodali condizionate dalla query.
  • L'audio ha una densità di informazioni rilevanti per il compito per token superiore rispetto al video.
  • Le dinamiche audio-visive locali sono più efficaci per la selezione visiva rispetto al confronto token per token.
  • Il video viene compresso prima dell'LLM, mentre l'audio viene preservato.
  • La potatura progressiva dei token audio e visivi a bassa rilevanza e delle voci di cache KV avviene all'interno dell'LLM.
  • Testato su Qwen2.5-Omni-7B e Qwen2.5-Omni-3B.
  • Ottiene le migliori prestazioni medie su quattro benchmark.
  • Identificatore dell'articolo: arXiv:2608.08794.

Entità

Istituzioni

  • arXiv

Fonti