MMAC: Un Benchmark Massivo Multidimensionale per il Audio Captioning
L'introduzione di un nuovo standard noto come MMAC (Massive Multi-dimensional benchmark for Audio Captioning) mira a valutare le capacità di audio captioning nei modelli linguistici di grandi dimensioni. Questo benchmark comprende 5.638 clip audio provenienti da oltre 20 diversi dataset, coprendo 6 categorie di capacità e 15 dimensioni di valutazione. Valuta se le didascalie prodotte dai modelli includono informazioni pertinenti e se queste informazioni sono allineate con le etichette di riferimento. Le analisi di AudioLLM sia open-source che proprietari hanno evidenziato variazioni significative nelle dimensioni, nella copertura informativa e nell'affidabilità delle descrizioni. Ulteriori dettagli sono disponibili su arXiv:2607.27109.
Fatti principali
- MMAC è un benchmark per l'audio captioning.
- Contiene 5.638 clip audio provenienti da oltre 20 fonti di dati.
- Copre 6 categorie di capacità e 15 dimensioni di valutazione.
- Verifica la copertura informativa e l'affidabilità delle descrizioni.
- Ha valutato AudioLLM open-source e proprietari.
- I risultati mostrano differenze tra le dimensioni di valutazione.
- L'articolo è disponibile su arXiv:2607.27109.
- Si concentra sul passaggio da descrizioni brevi a descrizioni aperte.
Entità
Istituzioni
- arXiv