Il Dataset SheetSage-A2S Migliora la Trascrizione Audio-Partitura per la Musica Popolare
Il dataset SheetSage-A2S è stato lanciato da ricercatori come risorsa pionieristica per gli studi audio-partitura (A2S) nella musica popolare. Questo dataset comprende 61 ore di audio con codifiche di partitura **kern per 9.468 segmenti derivati da 6.066 canzoni distinte. Il team di ricerca ha migliorato le metodologie A2S esistenti attraverso l'aumento dei dati e l'uso di MuQ, un modello preaddestrato progettato per l'estrazione di caratteristiche audio musicali, migliorando la generalizzazione e la rilevanza delle caratteristiche. Il loro modello ha registrato un tasso di errore simbolico (SER) del 4,98% sulla collezione Quartets nella musica classica, che rappresenta un notevole miglioramento rispetto al precedente miglior risultato del 15,3% SER. Per il dataset SheetSage-A2S, il modello ha raggiunto un SER del 20,92%, affrontando l'applicazione A2S trascurata nella musica popolare rispetto alla musica classica.
Fatti principali
- Il dataset SheetSage-A2S include 61 ore di audio con codifiche di partitura **kern per 9.468 clip provenienti da 6.066 canzoni uniche.
- È il primo dataset a facilitare la ricerca audio-partitura (A2S) per la musica popolare.
- Il modello A2S proposto utilizza l'aumento dei dati e MuQ, un modello preaddestrato per l'estrazione di caratteristiche audio musicali.
- Il modello raggiunge un tasso di errore simbolico (SER) del 4,98% sulla collezione Quartets per la musica classica.
- Il precedente stato dell'arte raggiungeva un SER del 15,3% sulla stessa collezione di musica classica.
- Sul dataset SheetSage-A2S per la musica popolare, il modello raggiunge un SER del 20,92%.
- I sistemi A2S esistenti si concentrano principalmente sulla musica classica, lasciando la musica popolare poco esplorata.
- L'articolo è disponibile su arXiv con l'identificatore 2608.06165.
Entità
Istituzioni
- arXiv