Post-addestramento con apprendimento per rinforzo FP4 per modelli linguistici di grandi dimensioni
I ricercatori presentano il primo post-addestramento con apprendimento per rinforzo FP4 end-to-end per modelli linguistici di grandi dimensioni, in cui sia le politiche di rollout che di addestramento operano con precisione a 4 bit. Uno studio sistematico identifica la quantizzazione delle attivazioni di rollout come la principale fonte di degrado, non la quantizzazione lato addestramento. I valori anomali nelle attivazioni causano underflow a zero sotto FP4. Ripristinare la politica di addestramento a precisione più alta mantenendo il rollout in FP4 peggiora l'accuratezza, rivelando che la mancata corrispondenza tra rollout e addestramento è la principale modalità di fallimento. Per affrontare questo problema, propongono Rollout Residual Quantization (Rollout-ResQ), un singolo termine di correzione residua con un pattern di sparsità hardware-friendly aggiunto solo alla moltiplicazione matriciale FP4 del rollout. Questa correzione leggera recupera le prestazioni.
Fatti principali
- Primo post-addestramento con apprendimento per rinforzo FP4 end-to-end per LLM
- Sia le politiche di rollout che di addestramento operano con precisione a 4 bit
- La quantizzazione delle attivazioni di rollout è la fonte dominante di degrado
- I valori anomali causano underflow delle attivazioni a zero sotto FP4
- Ripristinare la politica di addestramento a precisione più alta peggiora l'accuratezza
- La mancata corrispondenza tra rollout e addestramento è la principale modalità di fallimento
- Rollout-ResQ aggiunge un singolo termine di correzione residua
- La correzione è vincolata a un pattern di sparsità hardware-friendly
Entità
—