SPOT: Nuovo quadro per l'interpretazione delle politiche di apprendimento per rinforzo profondo
Una recente pubblicazione su arXiv (2608.09967) presenta SPOT (Sampling Policy Observation Tree), un quadro indipendente dal modello e basato sul campionamento per l'interpretazione delle politiche di apprendimento per rinforzo profondo (DRL). Campionando le azioni e simulando ricorsivamente gli stati successivi, questo quadro costruisce un albero interpretabile a orizzonte finito, utilizzando la politica e un simulatore dell'ambiente. Questo albero illustra empiricamente le preferenze di azione della politica e i loro possibili sviluppi futuri. Gli autori forniscono garanzie formali che SPOT può identificare asintoticamente l'azione più probabile della politica e analizzare il suo comportamento di disaccordo in scenari ad alta entropia. Dimostrato nel dominio del controllo del segnale stradale SUMO-RL, la rappresentazione ad albero aiuta a valutare il comportamento della politica, affrontando la sfida di decifrare i processi decisionali spesso opachi degli agenti DRL.
Fatti principali
- SPOT è un quadro indipendente dal modello e basato sul campionamento per l'interpretazione delle politiche DRL.
- Costruisce un albero interpretabile a orizzonte finito campionando le azioni e simulando gli stati successivi.
- Garanzie formali stabiliscono che SPOT recupera asintoticamente l'azione più probabile unica della politica.
- SPOT caratterizza il comportamento di disaccordo sotto politiche ad alta entropia.
- Dimostrato nel dominio del controllo del segnale stradale SUMO-RL.
- L'articolo è disponibile su arXiv con ID 2608.09967.
- Il quadro richiede l'accesso alla politica e a un simulatore dell'ambiente.
- La rappresentazione ad albero fornisce una visione empirica delle preferenze di azione e dell'evoluzione a valle.
Entità
Istituzioni
- arXiv