ARTFEED — Contemporary Art Intelligence

MPEcho: Framework AI per la Generazione Controllabile di Cover Song

ai-technology · 2026-07-30

Un nuovo framework AI chiamato MPEcho migliora la generazione di cover song incorporando un condizionamento esplicito a livello di fonema e confini temporali accurati nel modello SongEcho consolidato. Il SongEcho avanzato si basa su sequenze F0 e tag sonori/sordi, con conseguenti tassi di errore fonematico elevati a causa della sua dipendenza da dati linguistici impliciti. Traendo ispirazione dalla sintesi vocale cantata, MPEcho integra un codificatore di fonemi e un regolatore di lunghezza, portando a una notevole diminuzione dei tassi di errore fonematico. Per facilitare ciò, il team ha creato Phonsa, un modello di trascrizione automatica basato su Whisper, che fornisce annotazioni a livello di fonema ad alta precisione per voci cantate, affrontando la mancanza di coppie audio-fonema di qualità. I risultati sperimentali confermano l'efficacia di allineamento di Phonsa. La ricerca è disponibile su arXiv con ID 2607.26698.

Fatti principali

  • MPEcho è un framework generativo per la generazione controllabile di cover song.
  • Preserva il contenuto melodico e linguistico mentre ricrea altre componenti musicali.
  • Il modello all'avanguardia SongEcho utilizza sequenze F0 e tag V/UV.
  • Le informazioni linguistiche implicite di SongEcho portano a un alto tasso di errore fonematico (PER).
  • MPEcho integra un codificatore di fonemi e un regolatore di lunghezza in SongEcho.
  • MPEcho fornisce un condizionamento esplicito a livello di fonema e confini temporali precisi.
  • Phonsa è un modello di trascrizione automatica basato su Whisper per annotazioni fonematiche.
  • Phonsa supera la scarsità di coppie audio-fonema di alta qualità per voci cantate.

Entità

Istituzioni

  • arXiv

Fonti