ARTFEED — Contemporary Art Intelligence

L'esposizione di modelli pre-addestrati amplifica i rischi di jailbreak nei LLM finemente sintonizzati

ai-technology · 2026-08-07

Uno studio recente pubblicato su arXiv (ID 2512.14751) esamina se i modelli linguistici di grandi dimensioni (LLM) finemente sintonizzati ereditano le vulnerabilità di jailbreak dai loro omologhi pre-addestrati. Rilasciato come annuncio replace-cross, la ricerca introduce un modello di minaccia realistico in cui un attaccante ha accesso completo a un LLM pre-addestrato disponibile pubblicamente ma non può accedere alle sue versioni finemente sintonizzate proprietarie. I risultati empirici indicano che i prompt avversari ottimizzati per il modello pre-addestrato sono altamente trasferibili alle sue derivate finemente sintonizzate, rivelando vulnerabilità ereditate. Inoltre, il probing a livello di rappresentazione indica che questi prompt trasferibili sono linearmente separabili negli stati nascosti del modello pre-addestrato, suggerendo che le informazioni strutturali rilevanti sono codificate fin dall'inizio. Ciò evidenzia significative preoccupazioni per la sicurezza riguardo al rilascio di modelli pre-addestrati, sottolineando la necessità di forti protezioni durante l'intero processo di pre-addestramento e fine-tuning.

Fatti principali

  • Studio su arXiv ID 2512.14751
  • Tipo di annuncio: replace-cross
  • Si concentra su LLM finemente sintonizzati che ereditano vulnerabilità di jailbreak
  • Modello di minaccia: l'attaccante ha accesso completo al modello pre-addestrato, nessun accesso alle derivate finemente sintonizzate
  • I prompt avversari si trasferiscono dal modello pre-addestrato a quelli finemente sintonizzati
  • Il probing a livello di rappresentazione mostra separabilità lineare negli stati nascosti
  • I risultati evidenziano i rischi per la sicurezza del rilascio di modelli pre-addestrati

Entità

Istituzioni

  • arXiv

Fonti