MUPA2E: Framework Multimodale Unificato per la Valutazione delle Emozioni da Video Facciali e EEG
C'è questo nuovo studio che introduce un framework chiamato MUPA2E, che sta per Percezione Unificata Multimodale con Attenzione Asimmetrica per la Valutazione delle Emozioni. È costruito per analizzare sia video facciali che segnali EEG utilizzando un approccio unico di attenzione asimmetrica. L'obiettivo è migliorare il modo in cui valutiamo automaticamente le emozioni combinando dati neurali e comportamentali senza bisogno di processi separati per ciascun tipo. In questo metodo, i video facciali sono codificati con token di frame piegati sugli assi, mentre l'EEG può essere usato sia come dati grezzi che processati nel dominio spaziale. Testato sul dataset DMER, i migliori risultati sono arrivati dalla fusione di video ed EEG con uno stride di 30. Puoi trovare lo studio su arXiv con l'identificatore 2608.15999.
Fatti principali
- MUPA2E è un framework di percezione unificata per la valutazione delle emozioni.
- Elabora video facciali ed EEG attraverso un unico backbone condiviso di attenzione asimmetrica.
- Il video facciale è rappresentato tramite token di frame piegati sugli assi.
- L'EEG è processato come forma d'onda multicanale grezza o proiettato nel dominio spaziale.
- Valutato sul dataset DMER con protocollo stratificato indipendente dal soggetto.
- Confrontate configurazioni unimodali video, unimodali EEG e fuse video-EEG.
- La fusione combinata con stride 30 ha raggiunto la massima prestazione di validazione.
- L'articolo è disponibile su arXiv con ID 2608.15999.
Entità
Istituzioni
- arXiv