Backbone di Politica Adattiva: un Metodo RL di Meta-Transfer per Compiti Fuori Distribuzione
I ricercatori hanno introdotto l'Adaptive Policy Backbone (APB), una nuova tecnica di apprendimento per rinforzo di meta-transfer. Questo metodo incorpora strati lineari leggeri sia prima che dopo una rete backbone comune, facilitando la messa a punto efficiente dei parametri mantenendo al contempo la conoscenza esistente. APB migliora l'efficienza del campione rispetto alla RL tradizionale ed è in grado di adattarsi a compiti fuori distribuzione, dove i benchmark meta-RL attuali spesso falliscono. Affronta il problema delle discrepanze tra compiti di addestramento e di implementazione, che possono compromettere l'efficacia della conoscenza precedente, come dataset preesistenti o politiche di riferimento. L'articolo è disponibile su arXiv con identificativo 2509.22310 ed è categorizzato sotto Computer Science > Machine Learning.
Fatti principali
- APB è un metodo RL di meta-transfer che inserisce strati lineari leggeri prima e dopo un backbone condiviso.
- APB consente una messa a punto efficiente dei parametri (PEFT) preservando la conoscenza precedente durante l'adattamento.
- APB migliora l'efficienza del campione rispetto alla RL standard.
- APB si adatta a compiti fuori distribuzione (OOD) dove i baseline meta-RL esistenti tipicamente falliscono.
- Il metodo affronta la discrepanza tra compiti di addestramento e implementazione.
- L'articolo è disponibile su arXiv con identificativo 2509.22310.
- L'articolo è categorizzato sotto Computer Science > Machine Learning.
- Il metodo sfrutta prior come dataset pre-collezionati o politiche di riferimento.
Entità
Istituzioni
- arXiv