ARTFEED — Contemporary Art Intelligence

dots.tts.edit: Editing vocale di precisione con modello autoregressivo continuo

other · 2026-08-06

Un recente articolo accademico presenta dots.tts.edit, uno strumento di editing vocale che utilizza istruzioni di editing strutturale basate su trascrizione, caratterizzate da tag in stile XML per definire azioni tipizzate e confinarle a segmenti o limiti specifici della trascrizione. Questo sistema elimina la necessità di sincronizzazione diretta con i timestamp e offre un quadro verificabile per modifiche compositive. Lo strumento di editing deriva dal modello fondamentale dots.tts autoregressivo continuo. Include quattro controlli chiave per la creazione vocale, affrontando contenuto lessicale, tono emotivo, altezza e velocità di eloquio, nonché il fraseggio temporale tramite testo ed em. L'articolo è accessibile su arXiv con identificatore 2608.02673.

Fatti principali

  • L'articolo è intitolato 'dots.tts.edit: Editing vocale controllato con precisione con un modello autoregressivo continuo'.
  • È disponibile su arXiv con identificatore 2608.02673.
  • Il sistema utilizza un'istruzione di editing strutturale basata su trascrizione con tag in stile XML.
  • L'interfaccia specifica operazioni tipizzate e le localizza a intervalli o confini della trascrizione.
  • Evita l'allineamento esplicito dei timestamp.
  • L'editor è adattato dal modello fondamentale dots.tts autoregressivo continuo.
  • Quattro controlli rappresentativi per la creazione vocale coprono contenuto lessicale, espressione affettiva, altezza e velocità di eloquio, e fraseggio temporale.
  • L'articolo è classificato come annuncio di tipo incrociato.

Entità

Istituzioni

  • arXiv

Fonti