AgentOPSD: Auto-Distillazione Ricorsiva per l'Apprendimento per Rinforzo Agentico
Un recente articolo pubblicato su arXiv (2608.05987) presenta AgentOPSD, una nuova tecnica ricorsiva per l'assegnazione del credito a livello di turno nell'apprendimento per rinforzo agentico che non richiede un critico. Questo approccio affronta una sfida significativa nell'apprendimento per rinforzo con ricompense verificabili: le valutazioni del vantaggio a livello di traiettoria spesso trascurano le decisioni critiche che influenzano i risultati in compiti lunghi e multi-turno. AgentOPSD compila le discrepanze di log-probabilità insegnante-studente a livello di token in evidenze a livello di turno e aggiorna ricorsivamente uno stato di credenza bayesiano nello spazio log-odds, creando un metodo di riponderazione sistematico che trasforma la supervisione sparsa dell'esito in indicatori di credito a livello di turno. L'identificazione dei turni cruciali è ottenuta attraverso aggiustamenti marginali della credenza tra stati successivi. Questo metodo è completamente compatibile con le tecniche standard di policy gradient. Gli autori dell'articolo non sono specificati nell'abstract.
Fatti principali
- ID dell'articolo: arXiv:2608.05987
- Tipo di annuncio: nuovo
- Nome del metodo: AgentOPSD
- Approccio: metodo ricorsivo senza critico per l'assegnazione del credito a livello di turno
- Meccanismo: aggrega i divari di log-probabilità insegnante-studente a livello di token
- Aggiorna lo stato di credenza bayesiano nello spazio log-odds
- Identifica i turni cruciali tramite revisione marginale della credenza
- Compatibile con i metodi standard di policy gradient
Entità
Istituzioni
- arXiv