MEUSLI: IA vocale multilingue open-source per 28 lingue europee
Un team di ricercatori ha presentato MEUSLI, una famiglia innovativa di proiettori multilingue open-science che integra un codificatore vocale Whisper con modelli linguistici di grandi dimensioni (LLM) multilingue open-source. Questa innovazione facilita il riconoscimento automatico del parlato (ASR) end-to-end completamente open-source in 28 lingue europee, comprendendo sia lingue ad alta che a bassa disponibilità di risorse. MEUSLI si basa su precedenti sistemi monolingue e impiega metodi di apprendimento continuo per adattarsi senza problemi a lingue non incluse nel suo addestramento. Oltre all'ASR, questo proiettore può essere utilizzato anche per la traduzione vocale multilingue e l'identificazione di argomenti con una supervisione minima specifica per il compito. I risultati sono pubblicati in un articolo su arXiv (2607.22100), segnando un progresso fondamentale verso sistemi di IA multilingue inclusivi, liberi da modelli proprietari e limitazioni incentrate sull'inglese.
Fatti principali
- MEUSLI è la prima famiglia di proiettori multilingue open-science.
- Collega un codificatore Whisper con LLM multilingue open-source.
- Supporta ASR end-to-end in 28 lingue europee.
- Utilizza l'apprendimento continuo per estendersi a lingue non viste.
- Consente traduzione vocale e identificazione di argomenti con supervisione minima.
- Articolo disponibile su arXiv (2607.22100).
- Mira a ridurre la dipendenza da modelli proprietari.
- Copre sia lingue ad alta che a bassa disponibilità di risorse.
Entità
Istituzioni
- arXiv