CETalk: Controllo Continuo di Valenza-Arousal per la Generazione di Teste Parlanti 3D Guidate dall'Audio
Uno studio recente presenta CETalk, un nuovo framework progettato per la creazione di teste parlanti 3D con la capacità di controllare le emozioni in modo continuo. Pubblicato su arXiv con l'identificatore 2608.15110, questa ricerca affronta i limiti delle tecniche attuali che dipendono da categorie emotive fisse, che non riflettono adeguatamente la natura fluida delle emozioni. CETalk impiega modelli continui di Valenza-Arousal (VA) per una regolazione emotiva precisa. Il framework prevede una serie di parametri FLAME attraverso tre componenti principali: un Modulo di Modulazione Emotiva Dinamica che regola l'intensità emotiva in base ai segnali audio, un Sistema di Modellazione Temporale Multi-Scala che separa i movimenti del parlato ad alta frequenza dai cambiamenti emotivi a bassa frequenza, e un Meccanismo di Fusione Dinamica che combina queste diverse caratteristiche. Lo studio sottolinea la sfida posta dalla discrepanza nella frequenza temporale tra l'articolazione audio e l'espressione emotiva, rendendolo significativo per l'animazione di umani digitali e il calcolo affettivo.
Fatti principali
- CETalk è un framework per la generazione di teste parlanti 3D guidate dall'audio con controllo emotivo continuo.
- Utilizza rappresentazioni continue di Valenza-Arousal (VA) invece di categorie emotive discrete.
- Il framework prevede parametri FLAME per l'animazione facciale.
- Include un Modulo di Modulazione Emotiva Dinamica, un meccanismo di Modellazione Temporale Multi-Scala e un Meccanismo di Fusione Dinamica.
- L'articolo affronta la discrepanza nella frequenza temporale tra l'articolazione audio e l'espressione emotiva.
- La ricerca è pubblicata su arXiv con l'identificatore 2608.15110.
- L'articolo è classificato come annuncio di tipo incrociato.
- L'abstract è disponibile all'indirizzo https://arxiv.org/abs/2608.15110.
Entità
Istituzioni
- arXiv