Miscela di Encoder Vocali Consapevole delle Risorse per la Traduzione Multilingue da Voce a Testo
Un nuovo framework proposto, MSRT, descritto in un articolo su arXiv (2608.04586), affronta le sfide poste dalla multilinguità nella traduzione many-to-many da voce a testo (S2TT) per i modelli linguistici multimodali di grandi dimensioni (MLLM). Il problema deriva dall'uso di un singolo encoder vocale per diverse lingue, che porta alla dominanza delle lingue ad alte risorse e a un calo delle prestazioni per quelle a basse risorse. MSRT presenta una Miscela di Encoder Vocali Consapevole delle Risorse (MoSE) insieme a un router linguistico dedicato che assegna ogni enunciato all'encoder esperto appropriato. Include un esperto congelato per le lingue ad alte risorse e uno addestrabile per le lingue a medie e basse risorse. Inoltre, viene introdotta una strategia di apprendimento curriculare a cinque fasi per ridurre le esigenze di dati. Gli autori dell'articolo sono ricercatori e l'articolo è accessibile su arXiv.
Fatti principali
- MSRT è un nuovo framework per la traduzione many-to-many da voce a testo.
- Utilizza una Miscela di Encoder Vocali Consapevole delle Risorse (MoSE).
- MoSE include un router linguistico esplicito.
- Un encoder esperto congelato preserva le capacità per le lingue ad alte risorse.
- Un encoder esperto addestrabile si adatta alle lingue a medie e basse risorse.
- Il framework introduce una strategia di apprendimento curriculare a cinque fasi.
- L'articolo è disponibile su arXiv con ID 2608.04586.
- L'approccio mira a migliorare la coerenza multilingue nella S2TT.
Entità
Istituzioni
- arXiv