ARTFEED — Contemporary Art Intelligence

DialectS2S: Nuovo Modello di Dialogo Vocale End-to-End per Dialetti Cinesi a Basse Risorse

ai-technology · 2026-08-17

I ricercatori hanno introdotto DialectS2S, un modello di dialogo vocale end-to-end progettato specificamente per i dialetti cinesi a basse risorse. Il modello affronta la scarsità di dati vocali dialettali e l'incoerenza semantica che emerge durante l'adattamento dialettale. Una pipeline di sintesi scalabile costruisce i dati di addestramento, e una strategia di post-addestramento in due fasi con supervisione vocale auto-allineata allinea il contenuto semantico della supervisione vocale con le rappresentazioni evolute del modello, migliorando la stabilità e la naturalezza del parlato. Il lavoro è dettagliato in un articolo su arXiv (2608.08067).

Fatti principali

  • DialectS2S è un modello di dialogo vocale end-to-end per i dialetti cinesi.
  • Affronta scenari dialettali a basse risorse a causa della scarsità di dati vocali dialettali.
  • Il modello utilizza una pipeline di sintesi scalabile per la costruzione dei dati di dialogo vocale dialettale.
  • Viene introdotta una strategia di post-addestramento in due fasi con supervisione vocale auto-allineata.
  • La strategia allinea il contenuto semantico della supervisione vocale con le rappresentazioni semantiche evolute.
  • Mira a migliorare la stabilità e la naturalezza del parlato nella generazione dialettale.
  • L'articolo è disponibile su arXiv con ID 2608.08067.
  • Il tipo di annuncio è replace-cross.

Entità

Istituzioni

  • arXiv

Fonti