TANDEM: Framework AI per il Rilevamento Multimodale dell'Hate Speech
Un nuovo framework chiamato TANDEM è stato sviluppato da ricercatori per migliorare il rilevamento dell'odio audio-visivo, passando dalla semplice classificazione binaria al ragionamento strutturato. Utilizzando un metodo di apprendimento per rinforzo tandem, il sistema consente ai modelli visione-linguaggio e audio-linguaggio di perfezionarsi reciprocamente tramite un contesto cross-modale auto-vincolato, garantendo un ragionamento stabile su lunghe sequenze temporali senza richiedere una supervisione densa a livello di fotogramma. Questa innovazione affronta le complessità dei contenuti multimodali di lunga durata sui social media, dove le narrazioni dannose emergono da intricate interazioni tra elementi audio, visivi e testuali. A differenza dei tradizionali sistemi a scatola nera, TANDEM fornisce prove dettagliate e interpretabili, inclusi timestamp specifici e identità dei target, facilitando una moderazione efficace con intervento umano. I risultati sono stati testati su tre dataset di riferimento e pubblicati su arXiv (2601.11178v3).
Fatti principali
- TANDEM trasforma il rilevamento dell'odio audio-visivo dalla classificazione binaria al ragionamento strutturato
- Utilizza l'apprendimento per rinforzo tandem con modelli visione-linguaggio e audio-linguaggio
- I modelli si ottimizzano reciprocamente tramite contesto cross-modale auto-vincolato
- Stabilizza il ragionamento su sequenze temporali estese senza supervisione densa a livello di fotogramma
- Fornisce prove granulari e interpretabili, inclusi timestamp e identità dei target
- Affronta contenuti multimodali di lunga durata sui social media
- Esperimenti condotti su tre dataset di riferimento
- Articolo pubblicato su arXiv (2601.11178v3)
Entità
Istituzioni
- arXiv