Addestramento FP4 Stabilizzato tramite Quantizzazione a Blocchi 2D
Un nuovo metodo per l'addestramento di modelli linguistici di grandi dimensioni con precisione a virgola mobile a 4 bit (FP4) affronta l'instabilità causata dall'incoerenza di scala nella trasposizione dei tensori. La quantizzazione a blocchi 1D convenzionale assegna diversi fattori di scala agli stessi valori durante i passaggi forward e backward, portando a aggiornamenti del gradiente distorti. Il framework proposto utilizza la quantizzazione FP4 a blocchi 2D per imporre una scala invariante alla trasposizione, preservando la coerenza. Combinato con scaling senza troncamento e arrotondamento stocastico, controlla l'errore di quantizzazione e mantiene gradienti non distorti. La tecnica mira a migliorare l'efficienza dell'addestramento riducendo la precisione da FP8 a FP4 senza sacrificare la stabilità.
Fatti principali
- L'addestramento FP4 affronta l'instabilità dovuta all'incoerenza di scala dalla trasposizione dei tensori.
- La quantizzazione a blocchi 1D assegna diversi fattori di scala agli stessi valori dopo la trasposizione.
- Il metodo proposto utilizza la quantizzazione FP4 a blocchi 2D per una scala invariante alla trasposizione.
- Lo scaling senza troncamento e l'arrotondamento stocastico sono usati per controllare l'errore di quantizzazione.
- L'obiettivo è migliorare l'efficienza dell'addestramento dei LLM riducendo la precisione a FP4.
- L'articolo proviene da arXiv:2607.24953v1.
- L'approccio preserva la coerenza tra i calcoli forward e backward.
- I gradienti non distorti sono mantenuti attraverso le tecniche proposte.
Entità
Istituzioni
- arXiv