I dataset di volti sintetici perdono dati di addestramento reali, secondo uno studio
Uno studio recente pubblicato su arXiv ha sollevato preoccupazioni riguardo alle implicazioni sulla privacy dei dataset di volti sintetici. I ricercatori hanno indagato su quanto efficacemente questi dataset mantengano la riservatezza e hanno scoperto che un attacco di inferenza di appartenenza può identificare perfettamente il dataset sintetico associato a un sistema di riconoscimento facciale. Inoltre, lo studio ha dimostrato la capacità di risalire ai dati originali in oltre la metà dei casi testati. Analizzando 11 modelli di riconoscimento facciale insieme a 11 dataset sintetici e 7 reali, i risultati sottolineano la necessità di migliori protezioni della privacy. L'articolo di ricerca è referenziato come 2607.29144 e contribuisce alle discussioni in corso riguardanti le considerazioni etiche nell'uso di dati sintetici.
Fatti principali
- I dataset di volti sintetici sono utilizzati per ridurre l'esposizione alla privacy nel riconoscimento biometrico.
- I generatori per dataset sintetici sono addestrati su volti reali, potenzialmente perdendo dati reali.
- L'attacco identifica il dataset di addestramento sintetico nel 100% dei casi.
- L'attacco identifica il dataset di origine del generatore nel 54,5% dei casi.
- Lo studio ha testato 11 modelli di riconoscimento facciale, 11 dataset sintetici e 7 dataset reali.
- L'articolo è intitolato 'Have I Seen You? Embedding Behavior Signals Synthetic Face Dataset Membership'.
- L'articolo è disponibile su arXiv con identificativo 2607.29144.
- I risultati richiedono una mitigazione più forte delle perdite nella distribuzione che preserva la privacy.
Entità
Istituzioni
- arXiv