ARTFEED — Contemporary Art Intelligence

Miscela di Encoder Vocali Consapevole delle Risorse per la Traduzione Multilingue da Voce a Testo

ai-technology · 2026-08-06

Un nuovo framework proposto, MSRT, descritto in un articolo su arXiv (2608.04586), affronta le sfide poste dalla multilinguità nella traduzione many-to-many da voce a testo (S2TT) per i modelli linguistici multimodali di grandi dimensioni (MLLM). Il problema deriva dall'uso di un singolo encoder vocale per diverse lingue, che porta alla dominanza delle lingue ad alte risorse e a un calo delle prestazioni per quelle a basse risorse. MSRT presenta una Miscela di Encoder Vocali Consapevole delle Risorse (MoSE) insieme a un router linguistico dedicato che assegna ogni enunciato all'encoder esperto appropriato. Include un esperto congelato per le lingue ad alte risorse e uno addestrabile per le lingue a medie e basse risorse. Inoltre, viene introdotta una strategia di apprendimento curriculare a cinque fasi per ridurre le esigenze di dati. Gli autori dell'articolo sono ricercatori e l'articolo è accessibile su arXiv.

Fatti principali

  • MSRT è un nuovo framework per la traduzione many-to-many da voce a testo.
  • Utilizza una Miscela di Encoder Vocali Consapevole delle Risorse (MoSE).
  • MoSE include un router linguistico esplicito.
  • Un encoder esperto congelato preserva le capacità per le lingue ad alte risorse.
  • Un encoder esperto addestrabile si adatta alle lingue a medie e basse risorse.
  • Il framework introduce una strategia di apprendimento curriculare a cinque fasi.
  • L'articolo è disponibile su arXiv con ID 2608.04586.
  • L'approccio mira a migliorare la coerenza multilingue nella S2TT.

Entità

Istituzioni

  • arXiv

Fonti