L'esposizione di modelli pre-addestrati amplifica i rischi di jailbreak nei LLM finemente sintonizzati
Uno studio recente pubblicato su arXiv (ID 2512.14751) esamina se i modelli linguistici di grandi dimensioni (LLM) finemente sintonizzati ereditano le vulnerabilità di jailbreak dai loro omologhi pre-addestrati. Rilasciato come annuncio replace-cross, la ricerca introduce un modello di minaccia realistico in cui un attaccante ha accesso completo a un LLM pre-addestrato disponibile pubblicamente ma non può accedere alle sue versioni finemente sintonizzate proprietarie. I risultati empirici indicano che i prompt avversari ottimizzati per il modello pre-addestrato sono altamente trasferibili alle sue derivate finemente sintonizzate, rivelando vulnerabilità ereditate. Inoltre, il probing a livello di rappresentazione indica che questi prompt trasferibili sono linearmente separabili negli stati nascosti del modello pre-addestrato, suggerendo che le informazioni strutturali rilevanti sono codificate fin dall'inizio. Ciò evidenzia significative preoccupazioni per la sicurezza riguardo al rilascio di modelli pre-addestrati, sottolineando la necessità di forti protezioni durante l'intero processo di pre-addestramento e fine-tuning.
Fatti principali
- Studio su arXiv ID 2512.14751
- Tipo di annuncio: replace-cross
- Si concentra su LLM finemente sintonizzati che ereditano vulnerabilità di jailbreak
- Modello di minaccia: l'attaccante ha accesso completo al modello pre-addestrato, nessun accesso alle derivate finemente sintonizzate
- I prompt avversari si trasferiscono dal modello pre-addestrato a quelli finemente sintonizzati
- Il probing a livello di rappresentazione mostra separabilità lineare negli stati nascosti
- I risultati evidenziano i rischi per la sicurezza del rilascio di modelli pre-addestrati
Entità
Istituzioni
- arXiv