I residui di ricostruzione DiT multi-rapporto migliorano il rilevamento di deepfake audio cross-dominio
Esiste una nuova tecnica per individuare i deepfake audio che utilizza un Diffusion Transformer (DiT) congelato, specificamente addestrato su parlato reale come metodo per verificare l'autenticità. Questo metodo genera mappe di residui multi-rapporto a rapporti di mascheramento di 0,5, 0,75 e 0,9, progettate per essere sensibili al dominio audio. Il sistema di rilevamento combina rappresentazioni uditive WavLM congelate con questi residui utilizzando un metodo che evita l'attenuazione basata su gate tradizionale. Nell'ASVspoof 5 Eval, l'esecuzione seed-42 ha raggiunto un EER del 6,5442% e un min-DCF di 0,18456, mentre i punteggi ITW Full sono stati 13,8372% EER e 0,36921 min-DCF. La performance media su tre seed è stata del 6,8885% EER e 15,3328% min-DCF, superando un modello ottimizzato separatamente. Inoltre, l'aggiunta di supervisione ausiliaria ha migliorato la fusione dinamica ma ha influenzato negativamente tutti e tre i risultati dei seed.
Fatti principali
- Diffusion Transformer (DiT) addestrato solo su parlato genuino utilizzato come sonda di ricostruzione congelata.
- Mappe di residui multi-rapporto generate a rapporti di mascheramento 0,5, 0,75 e 0,9.
- Rivelatore ancorato all'audio che utilizza rappresentazione uditiva WavLM congelata proiettata con correzione additiva scalare con gate.
- Esecuzione seed-42 pre-specificata: 6,5442% EER / 0,18456 min-DCF su ASVspoof 5 Eval.
- Esecuzione seed-42 pre-specificata: 13,8372% EER / 0,36921 min-DCF su ITW Full.
- Medie su tre seed: 6,8885% (deviazione standard 0,3308%) su ASVspoof 5 Eval, 15,3328% (deviazione standard 2,0719%) su ITW Full.
- Media su tre seed di ITW Full inferiore al riferimento WavLM-ResNet18 ottimizzato separatamente.
- La supervisione ausiliaria peggiora l'EER ITW dal 18,4007% al 25,2968% medio.
Entità
—