Nuovo compito e benchmark di IA per il ragionamento video incentrato sulla persona
Per affrontare le carenze nel ragionamento video, i ricercatori hanno presentato il compito Identity-conditioned Queries (ICQ), che sfida il tradizionale framework video-testo che spesso semplifica eccessivamente il riconoscimento dell'identità e il ragionamento incentrato sulla persona. Questo compito obbliga i modelli a collegare e analizzare sia un video di input sia un'immagine di riferimento corrispondente di un individuo, facilitando il grounding dell'identità, la comprensione del comportamento e il ragionamento temporale. Per supportare questo sforzo, introducono ISYV (I Seek You in Videos), che comprende tre elementi chiave: ISYV-Bench, un benchmark di valutazione rigoroso con 1.377 video reali complessi e 1.377 coppie domanda-risposta su sei livelli di difficoltà; ISYV-75K, un dataset di addestramento completo con 75.000 campioni di alta qualità; e una soluzione modello. Questa ricerca è documentata in un articolo disponibile su arXiv (arXiv:2608.07417).
Fatti principali
- Introdotto il compito ICQ per il ragionamento congiunto su video e immagine di riferimento
- ISYV-Bench include 1.377 video e 1.377 coppie domanda-risposta
- Sei livelli di difficoltà dal riconoscimento dell'identità al ragionamento causale
- Il set di addestramento ISYV-75K contiene 75.000 campioni
- Articolo disponibile su arXiv con ID 2608.07417
- Affronta i limiti dei compiti esistenti di ragionamento video
- Focus sul ragionamento incentrato sulla persona e sul riconoscimento dell'identità
Entità
Istituzioni
- arXiv