Post-addestramento con Policy Gradient: Ottimalità e Barriera del Modello Base
Un recente articolo su arXiv (2603.06957v2) esplora il post-addestramento di modelli autoregressivi lineari utilizzando sia ricompense di risultato che di processo. I ricercatori dimostrano che quando il modello base raggiunge una verosimiglianza non banale α per i campioni di test, un approccio di policy gradient (PG) modificato può raggiungere una verosimiglianza di 1 - ε, richiedendo un numero minimax ottimale di query di ricompensa, in particolare O~((α^{-1} + ε^{-1})/γ^2). Tuttavia, sorgono sfide quando si cerca di estendersi oltre il supporto del modello base. L'errore atteso dopo il post-addestramento con ricompense di risultato è influenzato da una caratteristica nota come Quantile di Verosimiglianza (LQ). Sebbene le varianti di PG siano minimax ottimali, possono richiedere un numero esponenziale di query di ricompensa in N per superare questa limitazione. Lo studio amplia anche la condizione di separabilità convenzionale alle sequenze attraverso una condizione di margine γ, evidenziando vincoli essenziali delle tecniche di post-addestramento nell'IA, in particolare nell'apprendimento per rinforzo e nell'ottimizzazione dei modelli.
Fatti principali
- L'articolo arXiv:2603.06957v2 studia il post-addestramento di modelli autoregressivi lineari con ricompense di risultato e di processo.
- Una condizione di margine γ estende la separabilità standard alle sequenze.
- Una variante di policy gradient raggiunge una verosimiglianza di 1 - ε con query di ricompensa minimax ottimali O~((α^{-1} + ε^{-1})/γ^2) quando la verosimiglianza del modello base è α.
- Esiste una barriera per andare oltre il supporto del modello base.
- L'errore atteso dopo il post-addestramento è governato dalla proprietà del Quantile di Verosimiglianza (LQ) del modello base.
- Le varianti di PG possono richiedere query di ricompensa esponenziali in N per superare la barriera.
- L'articolo è disponibile su arXiv con tipo di annuncio replace-cross.
- La ricerca ha implicazioni per il post-addestramento dell'IA e l'apprendimento per rinforzo.
Entità
Istituzioni
- arXiv