Il Deep Learning Migliora la Stima della Matrice di Trasferimento Relativa per il Miglioramento del Parlato
Un recente articolo su arXiv (2608.11627) presenta tecniche innovative di deep learning volte a stimare la Matrice di Trasferimento Relativa (ReTM), che funge da estensione della funzione di trasferimento relativa applicabile a più sorgenti e ricevitori. Questa ReTM mostra potenziale per migliorare la chiarezza del parlato in ambienti rumorosi. I ricercatori propongono tre approcci di apprendimento supervisionato: reti convoluzionali nel dominio del tempo e nel dominio della trasformata di Fourier a breve termine, insieme a una rete neurale ricorrente LSTM (Long Short-Term Memory). I risultati sperimentali indicano che questi modelli forniscono una stima della ReTM superiore rispetto al metodo tradizionale basato sulla covarianza, valutata attraverso cinque metriche oggettive. Lo studio conferma anche l'efficacia dei framework nel migliorare la qualità del parlato. L'articolo completo è accessibile all'indirizzo https://arxiv.org/abs/2608.11627.
Fatti principali
- L'articolo arXiv:2608.11627 propone una stima della ReTM basata sul deep learning.
- Tre framework: CNN nel dominio del tempo, CNN nel dominio STFT e RNN basata su LSTM.
- I modelli superano il metodo basato sulla covarianza su cinque metriche oggettive.
- La ReTM generalizza la funzione di trasferimento relativa per più ricevitori e sorgenti.
- La stima della ReTM sfrutta le matrici di covarianza delle registrazioni multicanale.
- I modelli proposti mostrano efficacia per il miglioramento del parlato.
- Tipo di articolo: cross (annuncio).
- Pubblicato su arXiv.
Entità
Istituzioni
- arXiv