ARTFEED — Contemporary Art Intelligence

Il Pretraining Senza Critico Migliora l'Efficienza del Fine-Tuning Online nell'RL

ai-technology · 2026-08-13

Una nuova tecnica di machine learning nota come Pretraining Senza Critico (CFP) è stata presentata per migliorare l'efficacia dell'apprendimento per rinforzo offline-to-online (O2O). Questo metodo, descritto in un articolo sottoposto ad arXiv il 26 agosto 2025 (ID arXiv 2608.10473), affronta un problema significativo nell'O2O RL: il riutilizzo diretto di un critico addestrato offline può ostacolare il fine-tuning online. Poiché la politica e la distribuzione dei dati cambiano rapidamente durante le interazioni online, le stime di valore offline possono non allinearsi con il contesto online, portando a un miglioramento e a un'esplorazione della politica inefficaci. Il CFP elimina la necessità di addestrare un critico offline, consentendo a un critico appena inizializzato di adattarsi senza stime distorte. È compatibile con vari algoritmi O2O mainstream e spesso supera i metodi O2O tradizionali in una serie di compiti, specialmente in quelli più impegnativi. L'articolo include strumenti per citazioni, codice e dati e fa parte dell'iniziativa arXivLabs, che promuove sforzi sperimentali collaborativi.

Fatti principali

  • Il Pretraining Senza Critico (CFP) è un nuovo metodo per l'apprendimento per rinforzo offline-to-online.
  • Il CFP abbandona l'addestramento del critico offline per evitare stime di valore distorte.
  • Consente a un critico appena inizializzato di adattarsi durante il fine-tuning online.
  • Il CFP è compatibile con vari algoritmi O2O mainstream.
  • Eguaglia o migliora costantemente gli algoritmi O2O convenzionali.
  • Miglioramenti particolarmente pronunciati sono osservati in diversi compiti impegnativi.
  • L'articolo è disponibile su arXiv con ID 2608.10473.
  • Sottoposto alla categoria Computer Science > Machine Learning.

Entità

Istituzioni

  • arXiv

Fonti