Ex-Omni-2D: Dialogo Omni-Modale con Presenza Visiva Nativa
Il framework Ex-Omni-2D è stato sviluppato per consentire ai modelli di dialogo omni-modali di produrre output sincronizzati che includono testo, parlato personalizzato e video condizionati da riferimenti. Questo sistema innovativo, descritto in un articolo arXiv (2608.10720), supera i limiti degli attuali modelli omni-modali che generano risposte audio senza rappresentazione visiva. Quando viene presentata una query multimodale, insieme a un'immagine di riferimento e audio, Ex-Omni-2D genera un Piano di Pensiero Visivo (VTP) strutturato che delinea scena, emozione e movimento, seguito da testo e unità vocali native multi-codebook. Queste unità creano un'interfaccia acustico-temporale unificata, che viene decodificata in parlato e sincronizzata con i fotogrammi video. Questa configurazione consente l'apprendimento da diversi dataset di parlato, dialogo e video-avatar senza una supervisione estesa. Un Generatore Video a sequenza completa funge da istruttore principale per un addestramento efficace. L'articolo è stato recentemente sottomesso ad arXiv.
Fatti principali
- Ex-Omni-2D è un framework di dialogo omni-modale che genera risposte testuali, vocali e video.
- Utilizza un Piano di Pensiero Visivo (VTP) per descrivere scena, emozione e movimento.
- Il sistema impiega unità vocali native multi-codebook come interfaccia acustico-temporale condivisa.
- Allinea il parlato con i fotogrammi video in tempo reale.
- L'addestramento sfrutta dati eterogenei di parlato, dialogo e video-avatar.
- Un Generatore Video a sequenza completa funge da insegnante primario.
- L'articolo è arXiv:2608.10720.
- Il framework mira a fornire una presenza visiva nativa nel dialogo omni-modale.
Entità
Istituzioni
- arXiv