Apprendimento In-Contesto Condizionato dal Punteggio Rispecchia il Gradient Policy nei LLM
Un recente studio teorico pubblicato su arXiv (2607.23153) stabilisce un collegamento formale tra l'apprendimento in-contesto condizionato dal punteggio (ICL) nei grandi modelli linguistici e l'ottimizzazione del gradient policy. Gli autori presentano una dimostrazione costruttiva che mostra come i meccanismi di self-attention siano in grado di eseguire un'aggregazione pesata per ricompensa simile all'algoritmo REINFORCE, date certe configurazioni della matrice dei pesi. Elaborano su come questa connessione riguardi il funzionamento dei transformer pre-addestrati, sottolineando che la corrispondenza è direzionale nello spazio degli stati nascosti ed è strettamente valida solo in specifiche condizioni semplificatrici, che misurano empiricamente. Questa ricerca cerca di chiarire il meccanismo alla base della capacità dei LLM di migliorare gli output integrando campioni generati e punteggi di valutazione come esempi in-contesto, un fenomeno precedentemente notato ma non teorizzato.
Fatti principali
- L'articolo è su arXiv con ID 2607.23153
- Mostra che l'ICL condizionato dal punteggio corrisponde all'ottimizzazione del gradient policy
- La self-attention può implementare un'aggregazione pesata per ricompensa come REINFORCE
- La corrispondenza è direzionale nello spazio degli stati nascosti
- Vale esattamente solo in condizioni semplificatrici
- Quantifica empiricamente la forza della corrispondenza
- Spiega il miglioramento iterativo degli output dei LLM tramite esempi in-contesto
- Fornisce una dimostrazione costruttiva per specifiche configurazioni della matrice dei pesi
Entità
Istituzioni
- arXiv