Auto-Distillazione Calibrata sull'Osservazione per Agenti LLM
È stata introdotta una nuova tecnica nota come Auto-Distillazione Calibrata sull'Osservazione (OCSD) per migliorare il processo di addestramento degli agenti basati su modelli linguistici di grandi dimensioni (LLM). Questo metodo affronta una sfida complessa presente nell'Auto-Distillazione On-Policy (OPSD), che comporta la rivalutazione dei token generati attraverso una vista replay privilegiata per ottenere una guida dettagliata a livello di token. La sfida nasce perché il supporto di OPSD può rappresentare sia i dati privilegiati nella vista replay sia le alterazioni dei punteggi causate dallo scaffold di replay, complicando l'attribuzione del supporto a informazioni specifiche. Questo problema è particolarmente significativo quando le osservazioni ambientali future fungono da dati privilegiati, rendendo necessaria la ricostruzione di uno scaffold esteso che interrompe i punteggi dei token. OCSD affronta questo problema confrontando due scaffold strutturalmente simili per chiarire l'influenza delle informazioni privilegiate. La ricerca è accessibile su arXiv con l'identificatore 2608.04788 ed è stata annunciata come una sottomissione di tipo incrociato.
Fatti principali
- OCSD è proposto per risolvere la confusione in OPSD per gli agenti LLM.
- OPSD utilizza viste replay privilegiate per fornire una supervisione densa a livello di token.
- Il problema della confusione deriva dai cambiamenti di punteggio indotti dallo scaffold di replay.
- Le osservazioni ambientali future come informazioni privilegiate aggravano il problema.
- OCSD confronta due scaffold strutturalmente corrispondenti.
- L'articolo è disponibile su arXiv con ID 2608.04788.
- Il tipo di annuncio è 'cross'.
- Il metodo mira a migliorare l'apprendimento per rinforzo con ricompense a livello di traiettoria sparse.
Entità
Istituzioni
- arXiv