Riconoscimento delle Emozioni nel Parlato Persiano Basato su Whisper con Riduzione della Dimensionalità tramite PCA
Un nuovo studio condiviso su arXiv (2608.05165) si concentra sul riconoscimento delle emozioni nel parlato per il persiano, una lingua che manca di risorse abbondanti. I ricercatori propongono un metodo che estrae embedding a livello di frame utilizzando il modello Whisper di OpenAI. Applicano l'Analisi delle Componenti Principali (PCA) per semplificare i dati, riducendo la necessità di strati di proiezione complessi e minimizzando il numero di parametri da addestrare. Queste rappresentazioni efficienti vengono poi fuse utilizzando una tecnica di pooling basata sull'attenzione e classificate con un semplice strato di previsione. Esplorano anche se il fine-tuning di Whisper su un compito di riconoscimento vocale automatico (ASR) persiano migliora le prestazioni del SER. I test sul dataset ShEMO mostrano che la PCA riduce efficacemente le dimensioni mantenendo risultati competitivi, affrontando le sfide dei dati etichettati limitati nelle lingue a basse risorse.
Fatti principali
- L'articolo arXiv 2608.05165 si concentra sul riconoscimento delle emozioni nel parlato persiano (SER).
- Utilizza l'encoder Whisper per l'estrazione delle caratteristiche.
- La PCA riduce la dimensionalità degli embedding a livello di frame, eliminando gli strati di proiezione appresi.
- Il pooling basato sull'attenzione aggrega le rappresentazioni ridotte.
- Un semplice strato di previsione classifica le emozioni.
- Viene testato il fine-tuning di Whisper su ASR persiano per migliorare il SER.
- Gli esperimenti utilizzano il dataset ShEMO con valutazione indipendente dal parlante.
- Il metodo basato su PCA riduce i parametri addestrabili mantenendo le prestazioni.
Entità
Istituzioni
- OpenAI
- arXiv