ARTFEED — Contemporary Art Intelligence

RAPO: Un framework a doppio canale per il fine-tuning continuo di rinforzo consapevole del rischio

ai-technology · 2026-08-06

Un nuovo preprint arXiv (2608.03660) introduce l'ottimizzazione delle politiche consapevole del rischio (RAPO), un framework a doppio canale progettato per affrontare l'oblio catastrofico nel fine-tuning continuo di rinforzo (RFT) dei modelli linguistici multimodali di grandi dimensioni. Gli autori sostengono che, sebbene si creda generalmente che l'RFT resista all'oblio, fallisce in caso di cambiamenti pronunciati nella distribuzione dei compiti, portando a un rischio di ottimizzazione incontrollato. RAPO opera su due canali: il canale delle politiche utilizza il ridimensionamento delle politiche consapevole del rischio per calibrare adattivamente l'entità dell'aggiornamento per campione in base all'affidabilità del rollout e alla sensibilità predittiva locale ispirata a Fisher; il canale dei dati impiega il campionamento dinamico a bucket consapevole del rischio per riorganizzare i batch di addestramento tramite stratificazione dinamica del rischio. Il metodo è presentato come una strategia plug-and-play che richiede un'integrazione minima, con l'obiettivo di guidare l'ottimizzazione verso campioni informativi ma stabili. L'articolo è disponibile su arXiv con l'identificatore 2608.03660.

Fatti principali

  • L'articolo arXiv 2608.03660 propone RAPO
  • RAPO è un framework a doppio canale per l'RFT continuo
  • Affronta l'oblio catastrofico nei modelli linguistici multimodali di grandi dimensioni
  • Canale delle politiche: ridimensionamento delle politiche consapevole del rischio
  • Canale dei dati: campionamento dinamico a bucket consapevole del rischio
  • Utilizza l'affidabilità del rollout e la sensibilità predittiva locale ispirata a Fisher
  • Strategia plug-and-play
  • Pubblicato su arXiv

Entità

Istituzioni

  • arXiv

Fonti