Unlearning Resistente alle Perdite: Benchmarking della Coerenza nel Ragionamento Multi-Salto e della Robustezza al Recupero nei LLM
È stato istituito un nuovo benchmark denominato Leak-Resistant Unlearning per valutare l'efficacia delle tecniche di machine unlearning nei modelli linguistici di grandi dimensioni (LLM). Questo benchmark affronta due questioni significative: il rischio di perdita di conoscenza attraverso vari percorsi di ragionamento multi-salto e la suscettibilità dell'unlearning agli attacchi di recupero. I benchmark precedenti si sono concentrati principalmente su query a singolo salto e su una gamma limitata di domande multi-salto, che non valutano adeguatamente la completezza della rimozione della conoscenza. Il nuovo benchmark valuta i modelli attraverso una serie di percorsi di ragionamento e attacchi di recupero, inclusa l'adattamento leggero dopo l'unlearning. I test sono stati eseguiti su tre modelli, sei tecniche di unlearning e due dataset accuratamente selezionati. I risultati rivelano che i metodi di unlearning attuali sono a rischio di fronte a queste sfide. Questo benchmark mira a offrire una valutazione più approfondita dell'efficacia dell'unlearning, garantendo che le informazioni sensibili siano realmente cancellate e irrecuperabili. L'articolo è disponibile su arXiv con ID 2608.04519.
Fatti principali
- Introdotto un nuovo benchmark chiamato Leak-Resistant Unlearning
- Affronta la coerenza del ragionamento multi-salto e la robustezza al recupero
- I benchmark attuali includono principalmente domande a singolo salto
- Due sfide: perdita di conoscenza attraverso percorsi multi-salto e unlearning fragile
- Esperimenti su 3 modelli, 6 metodi di unlearning, 2 dataset
- I risultati mostrano che i metodi esistenti sono vulnerabili
- Il benchmark valuta attacchi di recupero come l'adattamento leggero post-unlearning
- Articolo disponibile su arXiv:2608.04519
Entità
Istituzioni
- arXiv