ARTFEED — Contemporary Art Intelligence

Post-addestramento con apprendimento per rinforzo FP4 per modelli linguistici di grandi dimensioni

ai-technology · 2026-07-30

I ricercatori presentano il primo post-addestramento con apprendimento per rinforzo FP4 end-to-end per modelli linguistici di grandi dimensioni, in cui sia le politiche di rollout che di addestramento operano con precisione a 4 bit. Uno studio sistematico identifica la quantizzazione delle attivazioni di rollout come la principale fonte di degrado, non la quantizzazione lato addestramento. I valori anomali nelle attivazioni causano underflow a zero sotto FP4. Ripristinare la politica di addestramento a precisione più alta mantenendo il rollout in FP4 peggiora l'accuratezza, rivelando che la mancata corrispondenza tra rollout e addestramento è la principale modalità di fallimento. Per affrontare questo problema, propongono Rollout Residual Quantization (Rollout-ResQ), un singolo termine di correzione residua con un pattern di sparsità hardware-friendly aggiunto solo alla moltiplicazione matriciale FP4 del rollout. Questa correzione leggera recupera le prestazioni.

Fatti principali

  • Primo post-addestramento con apprendimento per rinforzo FP4 end-to-end per LLM
  • Sia le politiche di rollout che di addestramento operano con precisione a 4 bit
  • La quantizzazione delle attivazioni di rollout è la fonte dominante di degrado
  • I valori anomali causano underflow delle attivazioni a zero sotto FP4
  • Ripristinare la politica di addestramento a precisione più alta peggiora l'accuratezza
  • La mancata corrispondenza tra rollout e addestramento è la principale modalità di fallimento
  • Rollout-ResQ aggiunge un singolo termine di correzione residua
  • La correzione è vincolata a un pattern di sparsità hardware-friendly

Entità

Fonti