Problemi di Stabilità nell'Addestramento RL di Modelli Linguistici Piccoli Identificati
Uno studio recente pubblicato su arXiv (2607.25091) analizza l'allineamento dell'apprendimento per rinforzo (RL) per modelli linguistici piccoli (SLM) con parametri da 70 a 500 milioni, scoprendo tre diverse modalità di fallimento riproducibili. I ricercatori hanno utilizzato l'ottimizzazione della politica prossimale (PPO) per addestrare quindici configurazioni di modelli e corpora, tra cui Pythia-70M, 160M, 410M e SmolLM2-135M, 360M, utilizzando dataset come TinyStories, CNN/DailyMail e Wikitext-103. I fallimenti identificati includono il congelamento silenzioso dei parametri LoRA all'interno dei framework standard PEFT/TRL, overflow numerico nei rapporti di importanza bfloat16 e collasso catastrofico della politica dovuto a imprecisioni del modello di ricompensa. Le soluzioni proposte comprendono un metodo di fusione e reinizializzazione degli adattatori, l'uso della precisione float32 durante gli aggiornamenti PPO e l'implementazione di un sistema di sicurezza a tre strati con whitening della ricompensa e protezione del rapporto di importanza.
Fatti principali
- arXiv:2607.25091
- SLM nell'intervallo di parametri 70–500M
- Quindici configurazioni (modello, corpus) addestrate
- PPO utilizzato per l'allineamento RL
- Modelli: Pythia-70M, 160M, 410M; SmolLM2-135M, 360M
- Corpora: TinyStories, CNN/DailyMail, Wikitext-103
- Tre modalità di fallimento identificate: congelamento silenzioso LoRA, overflow numerico, collasso catastrofico della politica
- Soluzioni: adattatore di fusione e reinizializzazione, precisione float32, meccanismo di sicurezza a tre strati
Entità
Istituzioni
- arXiv