ARTFEED — Contemporary Art Intelligence

Post-addestramento con Policy Gradient: Ottimalità e Barriera del Modello Base

ai-technology · 2026-08-13

Un recente articolo su arXiv (2603.06957v2) esplora il post-addestramento di modelli autoregressivi lineari utilizzando sia ricompense di risultato che di processo. I ricercatori dimostrano che quando il modello base raggiunge una verosimiglianza non banale α per i campioni di test, un approccio di policy gradient (PG) modificato può raggiungere una verosimiglianza di 1 - ε, richiedendo un numero minimax ottimale di query di ricompensa, in particolare O~((α^{-1} + ε^{-1})/γ^2). Tuttavia, sorgono sfide quando si cerca di estendersi oltre il supporto del modello base. L'errore atteso dopo il post-addestramento con ricompense di risultato è influenzato da una caratteristica nota come Quantile di Verosimiglianza (LQ). Sebbene le varianti di PG siano minimax ottimali, possono richiedere un numero esponenziale di query di ricompensa in N per superare questa limitazione. Lo studio amplia anche la condizione di separabilità convenzionale alle sequenze attraverso una condizione di margine γ, evidenziando vincoli essenziali delle tecniche di post-addestramento nell'IA, in particolare nell'apprendimento per rinforzo e nell'ottimizzazione dei modelli.

Fatti principali

  • L'articolo arXiv:2603.06957v2 studia il post-addestramento di modelli autoregressivi lineari con ricompense di risultato e di processo.
  • Una condizione di margine γ estende la separabilità standard alle sequenze.
  • Una variante di policy gradient raggiunge una verosimiglianza di 1 - ε con query di ricompensa minimax ottimali O~((α^{-1} + ε^{-1})/γ^2) quando la verosimiglianza del modello base è α.
  • Esiste una barriera per andare oltre il supporto del modello base.
  • L'errore atteso dopo il post-addestramento è governato dalla proprietà del Quantile di Verosimiglianza (LQ) del modello base.
  • Le varianti di PG possono richiedere query di ricompensa esponenziali in N per superare la barriera.
  • L'articolo è disponibile su arXiv con tipo di annuncio replace-cross.
  • La ricerca ha implicazioni per il post-addestramento dell'IA e l'apprendimento per rinforzo.

Entità

Istituzioni

  • arXiv

Fonti