MPEcho: Framework AI per la Generazione Controllabile di Cover Song
Un nuovo framework AI chiamato MPEcho migliora la generazione di cover song incorporando un condizionamento esplicito a livello di fonema e confini temporali accurati nel modello SongEcho consolidato. Il SongEcho avanzato si basa su sequenze F0 e tag sonori/sordi, con conseguenti tassi di errore fonematico elevati a causa della sua dipendenza da dati linguistici impliciti. Traendo ispirazione dalla sintesi vocale cantata, MPEcho integra un codificatore di fonemi e un regolatore di lunghezza, portando a una notevole diminuzione dei tassi di errore fonematico. Per facilitare ciò, il team ha creato Phonsa, un modello di trascrizione automatica basato su Whisper, che fornisce annotazioni a livello di fonema ad alta precisione per voci cantate, affrontando la mancanza di coppie audio-fonema di qualità. I risultati sperimentali confermano l'efficacia di allineamento di Phonsa. La ricerca è disponibile su arXiv con ID 2607.26698.
Fatti principali
- MPEcho è un framework generativo per la generazione controllabile di cover song.
- Preserva il contenuto melodico e linguistico mentre ricrea altre componenti musicali.
- Il modello all'avanguardia SongEcho utilizza sequenze F0 e tag V/UV.
- Le informazioni linguistiche implicite di SongEcho portano a un alto tasso di errore fonematico (PER).
- MPEcho integra un codificatore di fonemi e un regolatore di lunghezza in SongEcho.
- MPEcho fornisce un condizionamento esplicito a livello di fonema e confini temporali precisi.
- Phonsa è un modello di trascrizione automatica basato su Whisper per annotazioni fonematiche.
- Phonsa supera la scarsità di coppie audio-fonema di alta qualità per voci cantate.
Entità
Istituzioni
- arXiv