AdaKP: Selezione Adattiva Online di Punti di Conoscenza per l'Apprendimento per Rinforzo Orientato al Ragionamento
AdaKP è un selettore online che sceglie dinamicamente quali punti di conoscenza atomici (KP) iniettare nei prompt durante l'addestramento con apprendimento per rinforzo per modelli linguistici di grandi dimensioni. Affronta la scarsità di ricompense nella matematica a livello di competizione utilizzando un proxy di entropia per valutare i KP in base alla riduzione dell'entropia del token successivo, sostituendo la costosa stima basata su rollout. Il metodo prevede un singolo passaggio in avanti con un limite dimostrabile sul bias di troncamento, supportato da tre meccanismi leggeri. Questo approccio è presentato in un articolo su arXiv (2607.24833).
Fatti principali
- AdaKP è un metodo di selezione adattiva online dei punti di conoscenza.
- Si rivolge all'apprendimento per rinforzo orientato al ragionamento per modelli linguistici di grandi dimensioni.
- Il metodo affronta la scarsità di ricompense nella matematica a livello di competizione.
- I punti di conoscenza sono brevi suggerimenti in linguaggio naturale tratti da soluzioni gold.
- Un proxy di entropia valuta i KP in base alla riduzione dell'entropia del token successivo.
- La selezione utilizza un singolo passaggio in avanti con un limite dimostrabile sul bias di troncamento.
- Tre meccanismi leggeri rendono utilizzabile il segnale.
- L'articolo è disponibile su arXiv con ID 2607.24833.
Entità
Istituzioni
- arXiv