ARTFEED — Contemporary Art Intelligence

StuPASE: Miglioramento vocale di qualità da studio con basse allucinazioni

ai-technology · 2026-08-06

I ricercatori hanno introdotto StuPASE, un modello generativo di miglioramento vocale che raggiunge una qualità da studio riducendo al minimo le allucinazioni. Basato sul framework PASE, StuPASE affronta due limitazioni chiave: migliora la de riverberazione ottimizzando con target secchi invece di quelli con prime riflessioni simulate, e sostituisce il modulo basato su GAN con un modulo di flow-matching per gestire il rumore additivo forte. Gli esperimenti mostrano che StuPASE produce costantemente voce di alta qualità con basse allucinazioni, superando i metodi all'avanguardia. Demo audio disponibili online.

Fatti principali

  • StuPASE è un modello generativo di miglioramento vocale.
  • È basato sul framework PASE.
  • L'ottimizzazione con target secchi migliora la de riverberazione.
  • Il modulo di flow-matching sostituisce il modulo basato su GAN per la robustezza al rumore.
  • StuPASE raggiunge una qualità da studio con basse allucinazioni.
  • Supera i metodi SE all'avanguardia.
  • Demo audio disponibili su https://xiaobin (troncato).
  • Articolo annunciato su arXiv con ID 2603.09234.

Entità

Istituzioni

  • arXiv

Fonti