DLLM-TTS: Modello Linguistico a Diffusione Discreta a Blocchi per una Sintesi Vocale Efficiente
È stato presentato un nuovo sistema di sintesi vocale (TTS) denominato DLLM-TTS, che inquadra la TTS come una diffusione discreta a blocchi condizionata utilizzando i token del codec audio neurale X-Codec2. Questo metodo innovativo affronta il compromesso tra i modelli linguistici codec autoregressivi, che producono un parlato chiaro ma richiedono modelli estesi e decodifica sequenziale, e le tecniche non autoregressive che aumentano la velocità ma sacrificano la precisione linguistica. Il modello suddivide le sequenze in blocchi e applica una diffusione mascherata all'interno di questi blocchi, elaborandoli in sequenza per apprendere sia la coerenza acustica locale che l'allineamento complessivo testo-parlato. Con un fattore di tempo reale (RTF) di 0,15, la previsione parallela dei token durante l'inferenza consente una generazione efficiente. Un modello con 0,6 miliardi di parametri, addestrato su 20.000 ore, ottiene prestazioni competitive sul benchmark Seed-TTS-eval, dimostrando la praticità dei modelli linguistici a diffusione discreta a blocchi per la sintesi TTS.
Fatti principali
- DLLM-TTS è un framework per la sintesi vocale.
- Utilizza la diffusione discreta a blocchi condizionata sui token del codec audio neurale X-Codec2.
- Il modello scompone le sequenze in blocchi e applica una diffusione mascherata all'interno di ciascun blocco.
- I blocchi vengono elaborati in sequenza, apprendendo la coerenza acustica locale e l'allineamento globale testo-parlato.
- La previsione parallela dei token all'interno dei blocchi consente una generazione efficiente con un fattore di tempo reale (RTF) di 0,15.
- Un modello con 0,6 miliardi di parametri addestrato su 20.000 ore raggiunge prestazioni competitive sul benchmark Seed-TTS-eval.
- L'approccio bilancia intelligibilità e velocità, affrontando il compromesso nei sistemi TTS esistenti.
Entità
—