RL vs SFT: Differenze rappresentazionali nei modelli di ragionamento matematico
Uno studio recente pubblicato su arXiv (2607.26119) esplora le ragioni alla base delle prestazioni superiori dei grandi modelli di ragionamento addestrati tramite apprendimento per rinforzo (RL) rispetto a quelli ottimizzati con metodi supervisionati (SFT) in compiti di ragionamento matematico. Applicando sonde lineari agli stati nascosti attraverso i livelli, i ricercatori hanno scoperto che i modelli RL mostrano una maggiore accuratezza nel predire la correttezza delle risposte, suggerendo che le loro rappresentazioni sono più linearmente separabili. Inoltre, studi di ablazione media hanno indicato che i modelli RL creano una struttura gerarchica, con i livelli più profondi che diventano sempre più essenziali, mentre i modelli SFT mostrano una distribuzione più uniforme dell'importanza. Questi risultati implicano che l'addestramento RL altera fondamentalmente le rappresentazioni interne per migliorare le prestazioni.
Fatti principali
- Lo studio confronta modelli ottimizzati con RL e SFT sul ragionamento matematico
- Le sonde lineari mostrano che i modelli RL hanno maggiore accuratezza nel predire la correttezza delle risposte
- I modelli RL sviluppano un'architettura gerarchica con livelli più profondi critici
- I modelli SFT distribuiscono l'importanza uniformemente tra i livelli
- La ricerca fornisce una base meccanicistica per le prestazioni superiori di RL
- Pubblicato su arXiv con ID 2607.26119
- Utilizza studi di ablazione media per analizzare l'importanza dei livelli
- I risultati dimostrano che RL ristruttura le rappresentazioni interne
Entità
Istituzioni
- arXiv