La distillazione on-policy basata sul routing migliora il riallineamento della sicurezza dei LLM
Uno studio recente pubblicato su arXiv (2607.27081) presenta la Routing-based On-Policy Distillation (ROPD), un nuovo framework volto a migliorare il riallineamento della sicurezza nei modelli linguistici di grandi dimensioni (LLM) dopo il fine-tuning. Mentre il fine-tuning può incorporare comportamenti dannosi da fonti di dati nocive, spesso conserva le competenze professionali. Le attuali misure protettive affrontano problemi come l'oblio catastrofico delle abilità specializzate, il fallimento quando vengono utilizzati template di prompt sconosciuti e la suscettibilità a un nuovo jailbreak attraverso modifiche nei prompt di sistema. Invece di aderire a template specifici, ROPD si concentra sulla modellazione delle differenze tra le distribuzioni di probabilità di output allineate e compromesse, fornendo una soluzione più robusta. L'articolo presenta esperimenti completi che valutano ROPD rispetto a strategie alternative.
Fatti principali
- L'articolo arXiv 2607.27081 propone la Routing-based On-Policy Distillation (ROPD)
- ROPD affronta le vulnerabilità di sicurezza nei LLM dopo il fine-tuning
- Il fine-tuning può incorporare comportamenti dannosi da fornitori di dati malevoli
- Le difese esistenti causano l'oblio catastrofico delle competenze specializzate
- Le difese esistenti falliscono quando il template di prompt dell'attaccante è sconosciuto
- I modelli riallineati rimangono suscettibili a un nuovo jailbreak tramite cambi di prompt di sistema
- ROPD modella la divergenza tra le distribuzioni di probabilità di output allineate e compromesse
- Esperimenti estesi confrontano ROPD con altri metodi
Entità
Istituzioni
- arXiv