Nuovo articolo arXiv su portafogli di politiche adattive per processi decisionali di Markov robusti
Un recente articolo su arXiv (2608.17929v1) presenta portafogli di politiche adattive progettati per processi decisionali di Markov robusti (RMDP). I RMDP convenzionali tipicamente scelgono un'unica politica che funziona adeguatamente attraverso varie funzioni di transizione plausibili, il che può portare a un'eccessiva cautela quando le dinamiche rimangono sconosciute ma parzialmente identificabili dopo il dispiegamento. Gli autori suggeriscono di generare una collezione finita di politiche randomizzate senza memoria offline, completata da un semplice selettore online. Introducono il regret robusto come metrica per valutare l'efficacia del portafoglio: misura la perdita del membro migliore del portafoglio rispetto alla politica ottimale per un ambiente noto. Questa ricerca amplia gli obiettivi di regret esplorati da Ghavamzadeh et al. (2016), enfatizzando il miglioramento sicuro delle politiche. Inoltre, l'articolo offre una prospettiva di teoria della complessità, dimostrando che certificare un portafoglio è ∀R-completo, anche per portafogli deterministici in RMDP rettangolari (s,a) aciclici.
Fatti principali
- L'articolo è arXiv:2608.17929v1, annunciato come nuova sottomissione.
- Studia i processi decisionali di Markov robusti con portafogli di politiche adattive.
- I portafogli sono insiemi finiti di politiche randomizzate senza memoria sintetizzate offline.
- Un selettore online leggero viene utilizzato per scegliere tra i membri del portafoglio.
- Il regret robusto viene introdotto come misura della qualità del portafoglio.
- Vengono citati gli obiettivi di regret correlati di Ghavamzadeh et al. (2016).
- Si dimostra che certificare un portafoglio è ∀R-completo per portafogli deterministici in RMDP rettangolari (s,a) aciclici.
- L'approccio mira a ridurre il conservatorismo quando le dinamiche sconosciute diventano parzialmente identificabili.
Entità
Artisti
- Mohammad Ghavamzadeh
Istituzioni
- arXiv