Modello di attenzione leggero raggiunge il 96,37% di precisione nel riconoscimento della lingua dei segni bengalese
Quindi, c'è questa nuova rete convoluzionale leggera progettata per riconoscere la lingua dei segni bengalese (BdSL), ed è piuttosto notevole! Ha raggiunto un tasso di precisione del 96,37% su un dataset chiamato RSBdSL38, che contiene 10.874 immagini che coprono tutti i 38 segni BdSL che rappresentano le 51 lettere dell'alfabeto bengalese. Queste immagini sono state scattate da veri firmatari in tre scuole per bisogni speciali in Bangladesh. Il modello è abbastanza efficiente, con solo 298.470 parametri, e utilizza tecniche avanzate come meccanismi di attenzione e doppio pooling. È stato addestrato da zero e supera o è alla pari con altri nove modelli basati su ImageNet, mancando il punteggio massimo di solo 1,08%. Questa svolta potrebbe rendere più facile per la comunità dei sordi e degli ipoudenti in Bangladesh l'accesso all'istruzione e ai servizi. Lo studio è disponibile su arXiv con ID 2608.06252.
Fatti principali
- Il nuovo dataset RSBdSL38 contiene 10.874 immagini validate da esperti di tutti i 38 segni manuali BdSL.
- Il dataset rappresenta le 51 lettere dell'alfabeto bengalese.
- Le immagini sono state registrate da veri firmatari in tre scuole per bisogni speciali in Bangladesh.
- Il modello leggero proposto ha 298.470 parametri.
- Il modello raggiunge una precisione del 96,37% (95,72% ± 0,54% su cinque semi).
- Il modello è entro 1,08 punti percentuali dal miglior backbone pre-addestrato su ImageNet.
- Il modello utilizza blocchi residenziali a collo di bottiglia raggruppati, attenzione di canale e spaziale, blocco manuale multi-scala depthwise, doppio pooling e attivazioni Swish.
- La ricerca è stata annunciata su arXiv con identificatore 2608.06252.
Entità
Istituzioni
- arXiv
Luoghi
- Bangladesh