ARTFEED — Contemporary Art Intelligence

Metodo di campionamento per importanza selettiva per migliorare l'allineamento degli LLM nel post-addestramento RL

ai-technology · 2026-08-19

Un recente preprint su arXiv, identificato con il numero 2607.04728, introduce il Selective Importance Sampling (SIS), un metodo progettato per migliorare l'allineamento nei modelli linguistici di grandi dimensioni durante la fase di post-addestramento dell'apprendimento per rinforzo (RL). Questa fase impiega tipicamente una strategia 'rollout poi aggiornamento', che porta alla creazione di dati di addestramento off-policy. Mentre il campionamento per importanza (IS) mira a correggere questa discrepanza di distribuzione, i rapporti di importanza a livello di token possono portare a una varianza significativa in sequenze lunghe. SIS, basandosi sul campionamento per rifiuto (rejection sampling), risolve il problema convertendo i token off-policy in token on-policy, eliminando la necessità di correzioni dei punteggi di importanza per i token accettati. Gli autori affermano che SIS riduce il divario tra l'addestramento a livello di token e quello a livello di sequenza, presentando un approccio prezioso per migliorare l'allineamento degli LLM. Il documento è disponibile all'indirizzo https://arxiv.org/abs/2607.04728.

Fatti principali

  • Il post-addestramento RL per gli LLM segue un paradigma di rollout poi aggiornamento.
  • Questo paradigma comporta inevitabilmente dati di addestramento off-policy.
  • Il campionamento per importanza (IS) viene proposto per correggere i dati off-policy.
  • I rapporti di importanza a livello di token si accumulano su sequenze lunghe, causando una varianza severa.
  • Il Selective Importance Sampling (SIS) viene introdotto come approccio plug-in.
  • SIS si ispira al campionamento per rifiuto.
  • SIS tratta il modello off-policy come distribuzione proposta.
  • I token accettati ricevono un punteggio di importanza unitario, i token rifiutati mantengono la correzione IS standard.

Entità

Fonti