ARTFEED — Contemporary Art Intelligence

FOCUS: Nuovo Framework di Quantizzazione FP4 per un'Efficiente Distribuzione degli LLM

ai-technology · 2026-08-04

È stato introdotto un nuovo framework per la quantizzazione post-addestramento, denominato FOCUS, per affrontare i problemi di accuratezza associati alla quantizzazione FP4 nei modelli linguistici di grandi dimensioni (LLM). Questo framework è descritto in un articolo disponibile su arXiv (2608.01847) e presenta Coupled-Relaxation Scaling (CRS) insieme a Dual-Granularity Scaling per ottimizzare i parametri di scala. Sebbene i formati di quantizzazione FP4 come MXFP4 e NVFP4 siano supportati dagli acceleratori hardware moderni, ottenere accuratezza si è rivelato impegnativo. La limitazione principale deriva dall'accoppiamento stretto delle scale di quantizzazione e dequantizzazione, che devono aderire a formati discreti a bassa precisione come E8M0 in MXFP4. FOCUS affronta questo problema impiegando l'apprendimento end-to-end della scala, migliorando l'accuratezza e facilitando una distribuzione efficiente. Questa ricerca, annunciata come nuova sottomissione su arXiv, è fondamentale per ridurre al minimo le richieste computazionali e di memoria degli LLM, ampliando così la loro applicabilità in scenari reali.

Fatti principali

  • FOCUS è un framework di quantizzazione post-addestramento per l'ottimizzazione FP4.
  • Utilizza Coupled-Relaxation Scaling (CRS) e Dual-Granularity Scaling.
  • I formati FP4 come MXFP4 e NVFP4 hanno supporto hardware nativo.
  • I metodi esistenti accoppiano strettamente le scale di quantizzazione e dequantizzazione.
  • La scala di quantizzazione non viene mai memorizzata e non deve rispettare i vincoli hardware.
  • FOCUS utilizza l'apprendimento end-to-end della scala.
  • L'articolo è disponibile su arXiv con ID 2608.01847.
  • Il framework mira a migliorare l'accuratezza sotto precisione FP4.

Entità

Istituzioni

  • arXiv

Fonti