ARTFEED — Contemporary Art Intelligence

IndexTTS 2.5: Sintesi vocale multilingue migliorata con inferenza più rapida

ai-technology · 2026-08-13

IndexTTS 2.5 è stato lanciato come versione avanzata del modello fondamentale di sintesi vocale neurale zero-shot, migliorando le capacità rispetto al suo predecessore, IndexTTS 2. Questo aggiornamento aumenta la copertura multilingue, migliora la velocità di inferenza e eleva la qualità di sintesi. La frequenza dei frame del codec semantico è stata ridotta da 50 Hz a 25 Hz, dimezzando la lunghezza della sequenza. Inoltre, il modulo S2M beneficia di un backbone aggiornato, passando da U-DiT a Zipformer, che ottimizza la generazione dello spettrogramma mel. Un rapporto tecnico che dettaglia questi progressi è disponibile su arXiv con identificativo 2601.03888.

Fatti principali

  • IndexTTS 2.5 è una nuova versione del modello fondamentale di sintesi vocale neurale zero-shot.
  • Si basa su IndexTTS 2, che ha introdotto un modulo T2S basato su transformer e un modulo S2M non autoregressivo.
  • IndexTTS 2.5 migliora la copertura multilingue, la velocità di inferenza e la qualità complessiva della sintesi.
  • La frequenza dei frame del codec semantico è ridotta da 50 Hz a 25 Hz, dimezzando la lunghezza della sequenza.
  • Il backbone del modulo S2M è aggiornato da U-DiT a Zipformer, riducendo i parametri e accelerando la generazione dello spettrogramma mel.
  • Il rapporto tecnico è disponibile su arXiv con identificativo 2601.03888.
  • Il tipo di annuncio è 'replace-cross'.
  • Il modello mira a ridurre i costi di addestramento e inferenza migliorando al contempo le prestazioni.

Entità

Istituzioni

  • arXiv

Fonti