ARTFEED — Contemporary Art Intelligence

Il framework RCI migliora il Safe Offline RL sparso con inferenza dei costi basata sulla redistribuzione

ai-technology · 2026-08-13

Il framework Redistribution-based Cost Inference (RCI) affronta un problema significativo nell'apprendimento per rinforzo offline sicuro (RL): la dipendenza da annotazioni dettagliate dei costi per ogni passo. Tipicamente, i supervisori forniscono solo un feedback di stop a livello di traiettoria, un'indicazione binaria della prima transizione non sicura senza dettagli specifici per ogni passo. Il framework, descritto in arXiv:2608.12306, trasforma questo feedback limitato in costi completi per ogni passo attraverso la decomposizione del ritorno, facilitando l'addestramento di politiche offline vincolate su dataset potenziati. Lo studio rivela che la redistribuzione equivalente al ritorno mantiene l'insieme delle politiche ammissibili e il Lagrangiano ottimale in un Processo Decisionale di Markov Vincolato (CMDP), dimostrando che la trasformazione è teoricamente senza perdite, migliorando al contempo l'apprendimento del critico dei costi. Esperimenti in guida su autostrada e manipolazione robotica indicano tassi di violazione significativamente ridotti rispetto ai metodi sparsi e basati su classificatori, dimostrando robustezza contro diverse composizioni di dataset. Questa ricerca è cruciale per applicazioni pratiche in cui annotazioni dettagliate dei costi non sono fattibili, fornendo un approccio valido per il RL sicuro in ambienti complessi.

Fatti principali

  • RCI converte il feedback di stop sparso in costi densi per ogni passo tramite la decomposizione del ritorno.
  • Il framework preserva l'insieme delle politiche ammissibili e il Lagrangiano ottimale in un CMDP.
  • Esperimenti su guida in autostrada e manipolazione robotica mostrano tassi di violazione inferiori.
  • RCI supera i baseline sparsi e basati su classificatori.
  • Il metodo è robusto alla composizione eterogenea del dataset.
  • L'articolo è disponibile su arXiv con ID 2608.12306.
  • L'approccio affronta l'assegnazione del credito temporale nel safe offline RL.
  • La trasformazione è teoricamente senza perdite.

Entità

Istituzioni

  • arXiv

Fonti