ARTFEED — Contemporary Art Intelligence

RATTL introduce una robustezza dipendente dalle convinzioni per un processo decisionale sequenziale sicuro

ai-technology · 2026-08-19

Lo studio intitolato RATTL (Risk-Adversarial Total-Reward Learning), presentato nel preprint arXiv 2608.17574, indaga il livello di cautela che un agente dovrebbe adottare mentre naviga nel suo ambiente. Questa cautela è collegata all'incertezza epistemica attraverso un posteriore bayesiano, portando alla creazione di un insieme di ambiguità di Wasserstein, il cui raggio è una funzione monotona del posteriore. Man mano che vengono raccolte più evidenze, il raggio diminuisce, influenzando il comportamento di pianificazione dell'agente tra la massimizzazione delle ricompense totali e la garanzia di robustezza nel caso peggiore. Gli autori introducono un risultato di 'Safety Sandwich', dimostrando che la funzione valore di RATTL è limitata da un valore robusto non informato e dalla soluzione ottimale con conoscenza completa, convergendo infine al miglior risultato man mano che i dati vengono acquisiti. L'approccio allinea efficacemente la robustezza con lo stato di conoscenza dell'agente, rimanendo matematicamente gestibile.

Fatti principali

  • RATTL sta per Risk-Adversarial Total-Reward Learning.
  • Collega la cautela all'incertezza epistemica nel processo decisionale sequenziale.
  • L'agente mantiene un posteriore bayesiano sulle dinamiche sconosciute.
  • Viene utilizzato un insieme di ambiguità di Wasserstein, con raggio come funzione monotona del posteriore.
  • Il raggio si contrae con l'evidenza, adattando il comportamento tra robustezza nel caso peggiore e massimizzazione neutrale al rischio.
  • Il design segue una dualità alla base dell'Entropic Value-at-Risk (Valore a Rischio Entropico).
  • Il problema di pianificazione è ben posto sotto condizioni di transitorietà e compattezza.
  • Un teorema 'Safety Sandwich' mostra che il valore si colloca tra il robusto non informato e l'ottimo con piena conoscenza, con il divario che svanisce man mano che il posteriore si concentra.

Entità

Fonti