PASE: Miglioratore del parlato ancorato fonologicamente riduce le allucinazioni nella SE generativa
Un nuovo modello generativo di miglioramento del parlato, chiamato Phonologically Anchored Speech Enhancer (PASE), è stato proposto per affrontare i problemi di allucinazione in condizioni di rumore severo. La ricerca, pubblicata su arXiv (2511.13300), identifica due tipi di allucinazioni: linguistiche (contenuto parlato errato) e acustiche (caratteristiche del parlante incoerenti). Gli autori sostengono che l'allucinazione linguistica è più fondamentale, derivante dal fallimento dei modelli nel vincolare strutture fonologiche valide. Gli approcci esistenti che utilizzano modelli linguistici (LM) sono limitati perché apprendono da rappresentazioni corrotte dal rumore, portando a priori contaminati. PASE sfrutta il prior fonologico di WavLM per ancorare il processo di generazione, riducendo le allucinazioni e migliorando la qualità percettiva. L'articolo è un annuncio di tipo cross, indicando che potrebbe essere stato presentato altrove. Il lavoro è significativo per il campo del miglioramento del parlato, poiché mira a una limitazione critica dei modelli generativi in ambienti rumorosi del mondo reale.
Fatti principali
- PASE è un modello generativo di miglioramento del parlato.
- Affronta le allucinazioni linguistiche e acustiche.
- L'allucinazione linguistica è considerata più fondamentale.
- Gli approcci esistenti basati su LM soffrono di priori contaminati.
- PASE sfrutta il prior fonologico di WavLM.
- L'articolo è disponibile su arXiv con ID 2511.13300.
- Il tipo di annuncio è cross.
- Il modello mira a migliorare la qualità percettiva.
Entità
Istituzioni
- arXiv