UniPASE: Miglioramento vocale universale con alta fedeltà e basse allucinazioni
I ricercatori hanno presentato UniPASE, un modello generativo volto al miglioramento vocale universale (USE) che ripristina efficacemente i segnali vocali affetti da varie distorsioni a diverse frequenze di campionamento. Come descritto nell'articolo arXiv 2604.14606, questo modello si basa sul framework PASE a basse allucinazioni. Al suo centro si trova DeWavLM-Omni, un modulo di miglioramento a livello di rappresentazione che è stato ottimizzato da WavLM tramite distillazione della conoscenza utilizzando un dataset completo multi-distorsione. Trasforma forme d'onda compromesse in rappresentazioni fonetiche chiare, ottenendo un forte miglioramento con minime allucinazioni. Un Adapter produce quindi rappresentazioni acustiche migliorate per un Vocoder neurale, che ricostruisce forme d'onda ad alta fedeltà a 16 kHz, successivamente convertite a 48 kHz da un PostNet prima del ricampionamento. Questo modello affronta i problemi di miglioramento vocale universale ed è applicabile in apparecchi acustici, telecomunicazioni e assistenti vocali.
Fatti principali
- UniPASE è un modello generativo per il miglioramento vocale universale (USE).
- Estende il framework PASE a basse allucinazioni.
- Il modulo centrale è DeWavLM-Omni, ottimizzato da WavLM tramite distillazione della conoscenza.
- Addestrato su un dataset supervisionato su larga scala multi-distorsione.
- Converte forme d'onda degradate in rappresentazioni fonetiche pulite.
- L'Adapter genera rappresentazioni acustiche migliorate.
- Il Vocoder neurale ricostruisce forme d'onda ad alta fedeltà a 16 kHz.
- Il PostNet converte le forme d'onda a 48 kHz prima del ricampionamento alle frequenze originali.
Entità
—