Generazione vocale autoregressiva stabile con token continui ad alta dimensionalità e bassa frequenza di campionamento
Un recente preprint su arXiv (2607.29363) affronta le difficoltà di raggiungere un equilibrio tra lunghezza della sequenza, capacità rappresentativa e stabilità a lungo termine nella generazione audio e vocale autoregressiva (AR). I ricercatori suggeriscono un approccio di co-progettazione che integra una rappresentazione continua ad alta dimensionalità, alta larghezza di banda e bassa frequenza di campionamento con un framework di generazione in streaming, puntando a una ricostruzione ad alta fedeltà affidabile, una migliore prevedibilità dei singoli token e una maggiore stabilità a lungo orizzonte. Questo studio suddivide l'obiettivo in due sfide interconnesse: identificare le caratteristiche geometriche e statistiche dei token continui ad alta dimensionalità e creare un framework di generazione che possa utilizzarli efficacemente. L'articolo è classificato come annuncio di tipo cross ed è accessibile su arXiv.
Fatti principali
- ID dell'articolo: arXiv:2607.29363
- Tipo di annuncio: cross
- Focus: generazione vocale e audio autoregressiva
- Propone token continui ad alta dimensionalità e bassa frequenza di campionamento
- Obiettivo: migliorare la fedeltà di ricostruzione e la qualità della generazione
- Affronta la deriva della distribuzione e l'accumulo di errori AR
- Disponibile su arXiv
- Pubblicato nel 2025 (implicito dall'ID arXiv)
Entità
Istituzioni
- arXiv