Cat-DPO: Allineamento di Sicurezza Adattivo per LLM tramite Margini per Categoria
Un recente articolo pubblicato su arXiv (2604.17299) presenta Cat-DPO, un innovativo algoritmo di ottimizzazione diretta delle preferenze che affronta l'allineamento della sicurezza come un problema di ottimizzazione vincolata per ciascuna categoria. A differenza delle tecniche tradizionali che utilizzano un margine di sicurezza uniforme per tutte le coppie di preferenze, Cat-DPO si distingue applicando un margine di sicurezza adattivo su misura per ogni categoria di danno. Questo margine diventa più rigoroso quando le risposte non sicure persistono all'interno di una categoria e si allenta man mano che il modello mostra miglioramenti, consentendo al segnale di addestramento di riflettere le sfide uniche di ciascuna categoria piuttosto che fare affidamento su una singola metrica globale. Gli autori sostengono che l'allineamento della sicurezza basato sulle preferenze convenzionale semplifichi eccessivamente la sicurezza in un singolo scalare, portando a modelli che possono sembrare sicuri nel complesso ma sono ancora vulnerabili in categorie di danno meno comuni. Cat-DPO cerca di rimediare a questo problema regolando dinamicamente i vincoli di sicurezza per ciascuna categoria. L'articolo include esperimenti su due backbone LLM e sei benchmark di apprendimento delle preferenze, indicando che Cat-DPO migliora l'utilità complessiva garantendo al contempo la sicurezza, sebbene i risultati numerici specifici non siano dettagliati nell'abstract. Questa ricerca è significativa per la sicurezza dell'IA, soprattutto nel perfezionare i modelli linguistici di grandi dimensioni per bilanciare efficacemente l'utilità con il rifiuto di richieste dannose. L'articolo è accessibile su arXiv con l'identificatore 2604.17299, classificato come 'replace-cross'.
Fatti principali
- L'articolo arXiv:2604.17299 introduce Cat-DPO
- Cat-DPO è un algoritmo di ottimizzazione diretta delle preferenze con margini di sicurezza adattivi per categoria
- Tratta l'allineamento della sicurezza come un problema di ottimizzazione vincolata per categoria
- Il margine si restringe quando il modello produce risposte non sicure in una categoria e si allenta quando migliora
- Esperimenti condotti su due backbone LLM e sei benchmark di apprendimento delle preferenze
- Cat-DPO migliora l'utilità complessiva mantenendo la sicurezza
- L'articolo affronta il problema dei margini di sicurezza uniformi che portano a categorie minoritarie non sicure
- L'articolo è annunciato come 'replace-cross' su arXiv
Entità
Istituzioni
- arXiv