IndexTTS 2.5: Sintesi vocale multilingue migliorata con inferenza più rapida
IndexTTS 2.5 è stato lanciato come versione avanzata del modello fondamentale di sintesi vocale neurale zero-shot, migliorando le capacità rispetto al suo predecessore, IndexTTS 2. Questo aggiornamento aumenta la copertura multilingue, migliora la velocità di inferenza e eleva la qualità di sintesi. La frequenza dei frame del codec semantico è stata ridotta da 50 Hz a 25 Hz, dimezzando la lunghezza della sequenza. Inoltre, il modulo S2M beneficia di un backbone aggiornato, passando da U-DiT a Zipformer, che ottimizza la generazione dello spettrogramma mel. Un rapporto tecnico che dettaglia questi progressi è disponibile su arXiv con identificativo 2601.03888.
Fatti principali
- IndexTTS 2.5 è una nuova versione del modello fondamentale di sintesi vocale neurale zero-shot.
- Si basa su IndexTTS 2, che ha introdotto un modulo T2S basato su transformer e un modulo S2M non autoregressivo.
- IndexTTS 2.5 migliora la copertura multilingue, la velocità di inferenza e la qualità complessiva della sintesi.
- La frequenza dei frame del codec semantico è ridotta da 50 Hz a 25 Hz, dimezzando la lunghezza della sequenza.
- Il backbone del modulo S2M è aggiornato da U-DiT a Zipformer, riducendo i parametri e accelerando la generazione dello spettrogramma mel.
- Il rapporto tecnico è disponibile su arXiv con identificativo 2601.03888.
- Il tipo di annuncio è 'replace-cross'.
- Il modello mira a ridurre i costi di addestramento e inferenza migliorando al contempo le prestazioni.
Entità
Istituzioni
- arXiv