RATTL introduce una robustezza dipendente dalle convinzioni per un processo decisionale sequenziale sicuro
Lo studio intitolato RATTL (Risk-Adversarial Total-Reward Learning), presentato nel preprint arXiv 2608.17574, indaga il livello di cautela che un agente dovrebbe adottare mentre naviga nel suo ambiente. Questa cautela è collegata all'incertezza epistemica attraverso un posteriore bayesiano, portando alla creazione di un insieme di ambiguità di Wasserstein, il cui raggio è una funzione monotona del posteriore. Man mano che vengono raccolte più evidenze, il raggio diminuisce, influenzando il comportamento di pianificazione dell'agente tra la massimizzazione delle ricompense totali e la garanzia di robustezza nel caso peggiore. Gli autori introducono un risultato di 'Safety Sandwich', dimostrando che la funzione valore di RATTL è limitata da un valore robusto non informato e dalla soluzione ottimale con conoscenza completa, convergendo infine al miglior risultato man mano che i dati vengono acquisiti. L'approccio allinea efficacemente la robustezza con lo stato di conoscenza dell'agente, rimanendo matematicamente gestibile.
Fatti principali
- RATTL sta per Risk-Adversarial Total-Reward Learning.
- Collega la cautela all'incertezza epistemica nel processo decisionale sequenziale.
- L'agente mantiene un posteriore bayesiano sulle dinamiche sconosciute.
- Viene utilizzato un insieme di ambiguità di Wasserstein, con raggio come funzione monotona del posteriore.
- Il raggio si contrae con l'evidenza, adattando il comportamento tra robustezza nel caso peggiore e massimizzazione neutrale al rischio.
- Il design segue una dualità alla base dell'Entropic Value-at-Risk (Valore a Rischio Entropico).
- Il problema di pianificazione è ben posto sotto condizioni di transitorietà e compattezza.
- Un teorema 'Safety Sandwich' mostra che il valore si colloca tra il robusto non informato e l'ottimo con piena conoscenza, con il divario che svanisce man mano che il posteriore si concentra.
Entità
—