ARTFEED — Contemporary Art Intelligence

Il Dataset SheetSage-A2S Migliora la Trascrizione Audio-Partitura per la Musica Popolare

other · 2026-08-07

Il dataset SheetSage-A2S è stato lanciato da ricercatori come risorsa pionieristica per gli studi audio-partitura (A2S) nella musica popolare. Questo dataset comprende 61 ore di audio con codifiche di partitura **kern per 9.468 segmenti derivati da 6.066 canzoni distinte. Il team di ricerca ha migliorato le metodologie A2S esistenti attraverso l'aumento dei dati e l'uso di MuQ, un modello preaddestrato progettato per l'estrazione di caratteristiche audio musicali, migliorando la generalizzazione e la rilevanza delle caratteristiche. Il loro modello ha registrato un tasso di errore simbolico (SER) del 4,98% sulla collezione Quartets nella musica classica, che rappresenta un notevole miglioramento rispetto al precedente miglior risultato del 15,3% SER. Per il dataset SheetSage-A2S, il modello ha raggiunto un SER del 20,92%, affrontando l'applicazione A2S trascurata nella musica popolare rispetto alla musica classica.

Fatti principali

  • Il dataset SheetSage-A2S include 61 ore di audio con codifiche di partitura **kern per 9.468 clip provenienti da 6.066 canzoni uniche.
  • È il primo dataset a facilitare la ricerca audio-partitura (A2S) per la musica popolare.
  • Il modello A2S proposto utilizza l'aumento dei dati e MuQ, un modello preaddestrato per l'estrazione di caratteristiche audio musicali.
  • Il modello raggiunge un tasso di errore simbolico (SER) del 4,98% sulla collezione Quartets per la musica classica.
  • Il precedente stato dell'arte raggiungeva un SER del 15,3% sulla stessa collezione di musica classica.
  • Sul dataset SheetSage-A2S per la musica popolare, il modello raggiunge un SER del 20,92%.
  • I sistemi A2S esistenti si concentrano principalmente sulla musica classica, lasciando la musica popolare poco esplorata.
  • L'articolo è disponibile su arXiv con l'identificatore 2608.06165.

Entità

Istituzioni

  • arXiv

Fonti