ARTFEED — Contemporary Art Intelligence

PASE: Miglioratore del parlato ancorato fonologicamente riduce le allucinazioni nella SE generativa

ai-technology · 2026-08-06

Un nuovo modello generativo di miglioramento del parlato, chiamato Phonologically Anchored Speech Enhancer (PASE), è stato proposto per affrontare i problemi di allucinazione in condizioni di rumore severo. La ricerca, pubblicata su arXiv (2511.13300), identifica due tipi di allucinazioni: linguistiche (contenuto parlato errato) e acustiche (caratteristiche del parlante incoerenti). Gli autori sostengono che l'allucinazione linguistica è più fondamentale, derivante dal fallimento dei modelli nel vincolare strutture fonologiche valide. Gli approcci esistenti che utilizzano modelli linguistici (LM) sono limitati perché apprendono da rappresentazioni corrotte dal rumore, portando a priori contaminati. PASE sfrutta il prior fonologico di WavLM per ancorare il processo di generazione, riducendo le allucinazioni e migliorando la qualità percettiva. L'articolo è un annuncio di tipo cross, indicando che potrebbe essere stato presentato altrove. Il lavoro è significativo per il campo del miglioramento del parlato, poiché mira a una limitazione critica dei modelli generativi in ambienti rumorosi del mondo reale.

Fatti principali

  • PASE è un modello generativo di miglioramento del parlato.
  • Affronta le allucinazioni linguistiche e acustiche.
  • L'allucinazione linguistica è considerata più fondamentale.
  • Gli approcci esistenti basati su LM soffrono di priori contaminati.
  • PASE sfrutta il prior fonologico di WavLM.
  • L'articolo è disponibile su arXiv con ID 2511.13300.
  • Il tipo di annuncio è cross.
  • Il modello mira a migliorare la qualità percettiva.

Entità

Istituzioni

  • arXiv

Fonti