MemOPD: Distillazione On-Policy tramite Allineamento degli Stati di Memoria per Agenti a Lungo Orizzonte
Un recente preprint su arXiv (2608.07068v1) presenta MemOPD, una tecnica progettata per la distillazione on-policy (OPD) in agenti con capacità a lungo orizzonte. Questa ricerca affronta il problema dell'accumulo di contesto durante le interazioni, che influisce negativamente sia sulle prestazioni che sulla stabilità. Utilizzando una memoria compatta, il metodo comprime e aggiorna i dati storici tra le chiamate del modello. Tipicamente, il processo di determinare cosa mantenere dipende dall'ottimizzazione della politica prossimale (PPO) collegata alle ricompense finali del compito, dove ricompense sparse offrono una guida minima per gli aggiornamenti della memoria. MemOPD introduce la distillazione on-policy per fornire una supervisione densa da un insegnante durante i rollout degli studenti. Affinché questa supervisione sia efficace, l'insegnante deve valutare ogni azione campionata nello stesso stato in cui è stata generata. Il documento evidenzia che la compressione della memoria può interrompere questo allineamento, portando a un disallineamento nella valutazione delle azioni. Il metodo proposto cerca di sincronizzare gli stati di memoria per una supervisione valida. Questo preprint è di nuova pubblicazione ed è accessibile su arXiv.
Fatti principali
- arXiv:2608.07068v1
- Tipo di annuncio: nuovo
- Introduce MemOPD
- Affronta agenti a lungo orizzonte
- Utilizza la distillazione on-policy (OPD)
- Fornisce una supervisione densa dell'insegnante
- Identifica il problema con la riscrittura del contesto
- Mira ad allineare gli stati di memoria
Entità
Istituzioni
- arXiv