PD-GS: Splatting Gaussiano Guidato da Fonemi per Teste Parlanti Audio-Drive
Un recente articolo pubblicato su arXiv (2608.05218) presenta il Phoneme-Driven Gaussian Splatting (PD-GS), una tecnica progettata per migliorare la sincronizzazione labiale nel rendering di teste parlanti basate su audio. Questo metodo si basa sul 3D Gaussian Splatting (3DGS) incorporando token fonemici allineati temporalmente, provenienti da un framework di riconoscimento automatico del parlato (ASR) e allineamento forzato. Centrale in questo approccio è il Modulo di Fusione Linguistica (LFM), che fonde dinamicamente questi token fonemici per mitigare il problema della 'bocca che perde', dove i movimenti della bocca diventano eccessivamente levigati, superando i limiti articolatori come le chiusure bilabiali. Gli autori sostengono che le tecniche esistenti derivano azioni articolatorie discrete da segnali acustici continui, portando a previsioni distorte. PD-GS cerca di correggere questo offrendo una direzione precisa a livello di fonemi.
Fatti principali
- ID articolo: arXiv:2608.05218
- Tipo di annuncio: nuovo
- Propone il Phoneme-Driven Gaussian Splatting (PD-GS)
- Arricchisce il 3DGS con token fonemici allineati temporalmente
- Utilizza un pipeline ASR e di allineamento forzato
- Componente chiave: Modulo di Fusione Linguistica (LFM)
- Affronta l'artefatto della 'bocca che perde' nel rendering di teste parlanti
- Pubblicato su arXiv
Entità
Istituzioni
- arXiv