StuPASE: Miglioramento vocale di qualità da studio con basse allucinazioni
I ricercatori hanno introdotto StuPASE, un modello generativo di miglioramento vocale che raggiunge una qualità da studio riducendo al minimo le allucinazioni. Basato sul framework PASE, StuPASE affronta due limitazioni chiave: migliora la de riverberazione ottimizzando con target secchi invece di quelli con prime riflessioni simulate, e sostituisce il modulo basato su GAN con un modulo di flow-matching per gestire il rumore additivo forte. Gli esperimenti mostrano che StuPASE produce costantemente voce di alta qualità con basse allucinazioni, superando i metodi all'avanguardia. Demo audio disponibili online.
Fatti principali
- StuPASE è un modello generativo di miglioramento vocale.
- È basato sul framework PASE.
- L'ottimizzazione con target secchi migliora la de riverberazione.
- Il modulo di flow-matching sostituisce il modulo basato su GAN per la robustezza al rumore.
- StuPASE raggiunge una qualità da studio con basse allucinazioni.
- Supera i metodi SE all'avanguardia.
- Demo audio disponibili su https://xiaobin (troncato).
- Articolo annunciato su arXiv con ID 2603.09234.
Entità
Istituzioni
- arXiv