UNLINK-VL: Nuovo Benchmark per l'Unlearning della Conoscenza Cross-Modale nei Modelli Visione-Linguaggio
Un nuovo benchmark chiamato UNLINK-VL è stato sviluppato da ricercatori per valutare l'unlearning della conoscenza cross-modale nei Modelli Visione-Linguaggio (VLM). Questo benchmark colma una lacuna nella ricerca attuale sull'unlearning, che si è concentrata principalmente sull'oblio all'interno di singole modalità. Operando in un framework di unlearning post-hoc, UNLINK-VL non ha accesso ai corpora originali di dimenticanza e conservazione, ma si rivolge a entità del mondo reale visivamente identificabili. Queste entità sono collegate a immagini pertinenti e a fatti a uno e più salti derivati da Wikidata. Il benchmark include quattro sottoinsiemi distinti che analizzano varie sfaccettature dell'unlearning cross-modale. Questa ricerca è cruciale per creare sistemi di IA affidabili eliminando informazioni sensibili, protette da copyright o dannose dai VLM, analogamente ai Large Language Models (LLM). L'articolo è disponibile su arXiv con identificatore 2608.03791.
Fatti principali
- UNLINK-VL è un benchmark del mondo reale per l'unlearning della conoscenza cross-modale nei Modelli Visione-Linguaggio (VLM).
- Affronta la lacuna negli studi esistenti sull'unlearning che si concentrano sull'oblio all'interno di singole modalità.
- Il benchmark opera in un contesto di unlearning post-hoc in cui i corpora originali di dimenticanza e conservazione non sono disponibili.
- Seleziona entità del mondo reale visivamente identificabili come obiettivi di unlearning.
- Le entità sono associate a immagini corrispondenti e a fatti a uno e più salti derivati da Wikidata.
- Il benchmark comprende quattro sottoinsiemi complementari per la valutazione.
- Il lavoro mira a rimuovere conoscenze sensibili, protette da copyright o dannose dai VLM.
- L'articolo è disponibile su arXiv con identificatore 2608.03791.
Entità
Istituzioni
- arXiv