Il Pretraining Senza Critico Migliora l'Efficienza del Fine-Tuning Online nell'RL
Una nuova tecnica di machine learning nota come Pretraining Senza Critico (CFP) è stata presentata per migliorare l'efficacia dell'apprendimento per rinforzo offline-to-online (O2O). Questo metodo, descritto in un articolo sottoposto ad arXiv il 26 agosto 2025 (ID arXiv 2608.10473), affronta un problema significativo nell'O2O RL: il riutilizzo diretto di un critico addestrato offline può ostacolare il fine-tuning online. Poiché la politica e la distribuzione dei dati cambiano rapidamente durante le interazioni online, le stime di valore offline possono non allinearsi con il contesto online, portando a un miglioramento e a un'esplorazione della politica inefficaci. Il CFP elimina la necessità di addestrare un critico offline, consentendo a un critico appena inizializzato di adattarsi senza stime distorte. È compatibile con vari algoritmi O2O mainstream e spesso supera i metodi O2O tradizionali in una serie di compiti, specialmente in quelli più impegnativi. L'articolo include strumenti per citazioni, codice e dati e fa parte dell'iniziativa arXivLabs, che promuove sforzi sperimentali collaborativi.
Fatti principali
- Il Pretraining Senza Critico (CFP) è un nuovo metodo per l'apprendimento per rinforzo offline-to-online.
- Il CFP abbandona l'addestramento del critico offline per evitare stime di valore distorte.
- Consente a un critico appena inizializzato di adattarsi durante il fine-tuning online.
- Il CFP è compatibile con vari algoritmi O2O mainstream.
- Eguaglia o migliora costantemente gli algoritmi O2O convenzionali.
- Miglioramenti particolarmente pronunciati sono osservati in diversi compiti impegnativi.
- L'articolo è disponibile su arXiv con ID 2608.10473.
- Sottoposto alla categoria Computer Science > Machine Learning.
Entità
Istituzioni
- arXiv