Whisper-Large-v3-Turbo e IndicWav2Vec a pari merito nel benchmark ASR nepalese
Un nuovo articolo di ricerca su arXiv (2608.12327) presenta la prima analisi approfondita di sei modelli multilingue pre-addestrati finalizzati al riconoscimento automatico del parlato (ASR) nepalese. I modelli esaminati includono XLSR-53, IndicWav2Vec, MMS-1B, Whisper-Medium, Whisper-Large-v3-Turbo e Conformer-Hi, mostrando diverse architetture come CTC self-supervised e ibrido Conformer-CTC. Tutti i modelli sono stati ottimizzati utilizzando il dataset nepalese OpenSLR SLR54, che contiene circa 165 ore di audio, garantendo una pre-elaborazione e parametri di apprendimento coerenti. Sono stati testati su tre diversi dataset, concentrandosi su metriche come il tasso di errore delle parole (WER) e il tasso di errore dei caratteri (CER). È interessante notare che Whisper-Large-v3-Turbo e IndicWav2Vec hanno ottenuto prestazioni simili, suggerendo che famiglie linguistiche correlate possono bilanciare le differenze nella dimensione del modello per l'ASR nepalese. Lo studio osserva anche che i decoder CTC sono più veloci, rendendoli più adatti per applicazioni in tempo reale. Questa ricerca colma una lacuna negli studi ASR nepalesi, stabilendo un punto di riferimento per lavori futuri.
Fatti principali
- Primo benchmark controllato di sei modelli multilingue pre-addestrati per l'ASR nepalese
- Modelli ottimizzati sul corpus nepalese OpenSLR SLR54 (~165 ore)
- Pre-elaborazione, suddivisioni, ottimizzatore e pianificazioni del tasso di apprendimento identici utilizzati
- Valutati sui set di test OpenSLR, FLEURS e Common Voice
- Whisper-Large-v3-Turbo ha raggiunto un WER del 14,76%
- IndicWav2Vec ha raggiunto un WER del 14,89%
- Differenza di 9x nei parametri e di 40x nei dati di pre-addestramento tra i modelli migliori
- I decoder CTC sono più veloci, adatti per applicazioni in tempo reale
Entità
Istituzioni
- arXiv
- OpenSLR
- FLEURS
- Common Voice