LinUCB con Ricompensa Decadente Migliora il Perfezionamento Iterativo dei LLM
Un nuovo articolo di ricerca su arXiv (2608.06750) propone un algoritmo bandit contestuale che modella esplicitamente il decadimento della ricompensa per migliorare il perfezionamento iterativo nei modelli linguistici di grandi dimensioni (LLM). Gli autori sostengono che i metodi esistenti, come Self-Refine basato sul feedback e gli approcci bandit tradizionali, spesso si affidano a opzioni statiche o trascurano l'effetto di saturazione, portando a un'eccessiva sfruttamento in cui l'uso ripetuto di prompt o bracci identici produce ricompense decrescenti. Il loro algoritmo, che estende il framework Linear Upper Confidence Bound (LinUCB), utilizza un algoritmo Expectation-Maximization (EM) per stimare simultaneamente i parametri specifici del braccio e quelli di decadimento. Incorporando i prompt come bracci, il metodo facilita l'apprendimento congiunto dei valori dei bracci, distinguendosi dall'approccio LinUCB disgiunto. I risultati sperimentali sui benchmark Sentiment Reversal e GSM8K dimostrano miglioramenti significativi delle prestazioni. L'articolo è classificato come annuncio di tipo incrociato ed è stato pubblicato su arXiv.
Fatti principali
- ID dell'articolo: arXiv:2608.06750
- Propone un algoritmo bandit contestuale con modellazione del decadimento della ricompensa
- Utilizza l'algoritmo Expectation-Maximization (EM) per stimare i parametri specifici del braccio e quelli di decadimento
- Incorpora i prompt come bracci per l'apprendimento congiunto dei valori dei bracci
- Si distingue dal Linear Upper Confidence Bound (LinUCB) disgiunto
- Valutato sui benchmark Sentiment Reversal e GSM8K
- Affronta l'eccessivo sfruttamento nel perfezionamento iterativo
- Pubblicato su arXiv con annuncio di tipo incrociato
Entità
Istituzioni
- arXiv