ST-OmniQA: Nuovo Benchmark per il Ragionamento Spazio-Temporale Audio-Visivo sugli Eventi Sonori
Un nuovo benchmark chiamato ST-OmniQA è stato lanciato dai ricercatori per valutare il ragionamento spazio-temporale audio-visivo nei modelli linguistici. Questo benchmark colma un'importante lacuna nelle tecnologie AI esistenti, poiché i modelli audio-linguistici tipicamente considerano i clip come eventi acustici complessivi, mentre i modelli visione-linguaggio spesso trascurano le informazioni audio spaziali. ST-OmniQA valuta la capacità di identificare le sorgenti sonore, le loro posizioni e i loro movimenti nel tempo. Consiste in 40.000 video e 400.000 coppie domanda-risposta, categorizzati in quattro livelli di capacità, inclusi il riconoscimento degli eventi sonori e le traiettorie di movimento. Inoltre, i ricercatori hanno introdotto ST-Omni-R1, un modello che combina rappresentazioni derivate da FOA con visuali panoramiche. Questo lavoro è documentato in un nuovo articolo arXiv (ID: 2608.09435), segnando un passo avanti significativo per i modelli linguistici omni-modali.
Fatti principali
- ST-OmniQA è un nuovo benchmark per il ragionamento spazio-temporale audio-visivo.
- Include 40.000 video e 400.000 coppie domanda-risposta.
- Il benchmark utilizza video panoramici con audio Ambisonics di primo ordine (FOA) sincronizzato.
- Copre quattro livelli di capacità: riconoscimento degli eventi sonori, direzione di arrivo, distanza della sorgente, traiettorie di movimento e ragionamento temporalmente fondato.
- ST-Omni-R1 è un modello proposto che integra rappresentazioni derivate da FOA con contesto visivo.
- L'articolo è disponibile su arXiv con ID 2608.09435.
- Il lavoro affronta le limitazioni dei modelli audio-linguistici e visione-linguaggio esistenti.
- Il tipo di annuncio è 'nuovo'.
Entità
Istituzioni
- arXiv