ARTFEED — Contemporary Art Intelligence

Problemi di Stabilità nell'Addestramento RL di Modelli Linguistici Piccoli Identificati

ai-technology · 2026-07-29

Uno studio recente pubblicato su arXiv (2607.25091) analizza l'allineamento dell'apprendimento per rinforzo (RL) per modelli linguistici piccoli (SLM) con parametri da 70 a 500 milioni, scoprendo tre diverse modalità di fallimento riproducibili. I ricercatori hanno utilizzato l'ottimizzazione della politica prossimale (PPO) per addestrare quindici configurazioni di modelli e corpora, tra cui Pythia-70M, 160M, 410M e SmolLM2-135M, 360M, utilizzando dataset come TinyStories, CNN/DailyMail e Wikitext-103. I fallimenti identificati includono il congelamento silenzioso dei parametri LoRA all'interno dei framework standard PEFT/TRL, overflow numerico nei rapporti di importanza bfloat16 e collasso catastrofico della politica dovuto a imprecisioni del modello di ricompensa. Le soluzioni proposte comprendono un metodo di fusione e reinizializzazione degli adattatori, l'uso della precisione float32 durante gli aggiornamenti PPO e l'implementazione di un sistema di sicurezza a tre strati con whitening della ricompensa e protezione del rapporto di importanza.

Fatti principali

  • arXiv:2607.25091
  • SLM nell'intervallo di parametri 70–500M
  • Quindici configurazioni (modello, corpus) addestrate
  • PPO utilizzato per l'allineamento RL
  • Modelli: Pythia-70M, 160M, 410M; SmolLM2-135M, 360M
  • Corpora: TinyStories, CNN/DailyMail, Wikitext-103
  • Tre modalità di fallimento identificate: congelamento silenzioso LoRA, overflow numerico, collasso catastrofico della politica
  • Soluzioni: adattatore di fusione e reinizializzazione, precisione float32, meccanismo di sicurezza a tre strati

Entità

Istituzioni

  • arXiv

Fonti