ARTFEED — Contemporary Art Intelligence

Imitazione selettiva Max-Q per l'apprendimento robotico online con intervento umano nel ciclo

ai-technology · 2026-08-18

Un nuovo approccio di addestramento per l'apprendimento per rinforzo online con intervento umano nel ciclo (HIL) su robot reali è stato dettagliato in un articolo su arXiv (2608.15088). Questa tecnica integra due elementi chiave: un critico MC Q-chunk e l'imitazione selettiva max-Q. Il critico valuta i valori d'azione a livello di chunk utilizzando i ritorni Monte Carlo dal buffer di replay, consentendo l'attribuzione diretta delle traiettorie di intervento attraverso una valutazione della politica basata sulla media campionaria. L'attore si aggiorna imitando l'azione con Q maggiore in ogni stato, scegliendo tra l'azione della politica corrente e un campione dal buffer in base a un principio rigoroso del vincitore prende tutto. Questo metodo facilita una rapida integrazione degli interventi umani, promuovendo al contempo un miglioramento continuo oltre l'input umano iniziale. Il team di ricerca è accreditato come autore e l'articolo è disponibile su arXiv.

Fatti principali

  • L'articolo è disponibile su arXiv con ID 2608.15088.
  • Il metodo utilizza un critico MC Q-chunk per la valutazione della politica basata sulla media campionaria.
  • L'imitazione selettiva max-Q utilizza una regola rigida del vincitore prende tutto.
  • La regola alterna tra l'apprendimento dagli interventi e l'auto-miglioramento on-policy.
  • Il metodo è progettato per robot reali nell'apprendimento per rinforzo online con intervento umano nel ciclo.
  • L'obiettivo è assorbire rapidamente gli interventi umani migliorando oltre la conoscenza umana iniziale.
  • L'approccio riduce il divario tra target e campione della politica.
  • L'articolo è un annuncio di tipo incrociato.

Entità

Istituzioni

  • arXiv

Fonti