ARTFEED — Contemporary Art Intelligence

ORPA: Adattamento della Politica Residua in Tempo Reale per la Manipolazione Robotica

ai-technology · 2026-08-19

Il framework recentemente introdotto, ORPA—Online Residual Policy Adaptation—consente aggiustamenti immediati alle azioni di manipolazione robotica senza dover riaddestrare la politica principale. Pensato per strategie di apprendimento per imitazione come Action Chunking with Transformers (ACT), ORPA include un modulo condizionato dal feedback che prevede le modifiche residue necessarie nello spazio articolare, consentendo cambiamenti comportamentali in tempo reale. I metodi convenzionali richiedono una costosa raccolta di dati e il riaddestramento completo della politica, il che è impraticabile per applicazioni in tempo reale. Sfruttando il feedback umano, ORPA affina le politiche di controllo pre-addestrate per correzioni istantanee. Testato su compiti critici in termini di precisione utilizzando la piattaforma ALOHA, i risultati hanno mostrato tassi di successo migliorati, riflettendo una maggiore robustezza. Il preprint arXiv:2608.17323 illustra la metodologia, il design del modulo e i risultati della valutazione, presentando una soluzione praticabile per adattare le politiche dei robot in ambienti in continua evoluzione.

Fatti principali

  • ORPA sta per Online Residual Policy Adaptation (Adattamento Online della Politica Residua), un framework per il controllo della manipolazione robotica.
  • ORPA consente la correzione immediata e guidata dal feedback delle azioni del robot senza modificare i parametri della politica.
  • Aumenta una politica di controllo pre-addestrata con un modulo leggero e condizionato dal feedback.
  • Il modulo prevede aggiustamenti residui direttamente nello spazio articolare.
  • ORPA è stato valutato su compiti di manipolazione sensibili alla precisione utilizzando la piattaforma ALOHA.
  • Gli esperimenti hanno dimostrato miglioramenti nel tasso di successo.
  • L'approccio affronta la sensibilità delle politiche di apprendimento per imitazione come ACT agli errori di esecuzione e ai cambiamenti di distribuzione.
  • Le soluzioni tradizionali richiedono aggregazione di dataset e riaddestramento completo della politica, che è computazionalmente costoso.

Entità

Fonti