ARTFEED — Contemporary Art Intelligence

Impatto Disomogeneo dell'Adattamento dei Compiti sull'Allineamento degli LLM Studiato

ai-technology · 2026-07-29

Uno studio recente ha esaminato gli effetti di vari metodi di post-addestramento sull'allineamento dei modelli linguistici di grandi dimensioni (LLM). Sono stati valutati tre metodi: Supervised Fine-Tuning (SFT), SFT con regolarizzazione KL e Reinforcement Learning via Reward (RLVR). La ricerca ha valutato 15 aspetti di allineamento in sei domini, rivelando che RLVR migliora le prestazioni del compito con modifiche minime all'allineamento, mentre SFT porta a una maggiore deriva dell'allineamento. Al contrario, la regolarizzazione KL mitiga efficacemente la deriva. Lo studio è accessibile su arXiv con ID articolo 2607.22676.

Fatti principali

  • Lo studio valuta metodi di post-addestramento sull'allineamento degli LLM
  • Metodi testati: SFT, SFT con regolarizzazione KL e RLVR
  • 15 aspetti di allineamento in 6 domini
  • RLVR migliora le prestazioni del compito con piccoli cambiamenti nell'allineamento
  • SFT causa una maggiore deriva dell'allineamento
  • La regolarizzazione KL riduce la deriva
  • Studio disponibile su arXiv
  • ID articolo: 2607.22676

Entità

Istituzioni

  • arXiv

Fonti