F-WANDA: Metodo di potatura efficiente per una distribuzione sostenibile di LLM
Uno studio recente pubblicato su arXiv (2608.00481) presenta F-WANDA, un metodo per la potatura post-addestramento di modelli linguistici di grandi dimensioni (LLM) che bilancia efficacemente prestazioni ed efficienza computazionale. A differenza di metodi precedenti come WANDA, che compromette la qualità, e SPARSEGPT, noto per le sue elevate richieste computazionali, F-WANDA ridistribuisce il budget di mantenimento per riga attraverso i neuroni di output utilizzando l'informazione di Fisher empirica derivata dalla pre-attivazione. Questo segnale di Fisher viene calcolato attraverso un singolo passaggio all'indietro aggiuntivo sullo stesso set di dati di calibrazione utilizzato da WANDA, senza alcuna modifica dei pesi. Quando testato su LLAMA-2-7B con sparsità non strutturata del 50%, F-WANDA raggiunge una perplessità WikiText-2 di 6.85, eguagliando la fluidità di WANDA, e migliora il 5-shot MMLU di +1.6 punti percentuali rispetto a WANDA e +1.1 rispetto a SPARSEGPT, consumando solo un terzo del tempo di potatura e dell'energia di SPARSEGPT. Ciò è ottenuto senza bisogno di dati di calibrazione aggiuntivi o fine-tuning, posizionando F-WANDA all'avanguardia nel rapporto qualità-costo di potatura per una distribuzione sostenibile degli LLM.
Fatti principali
- F-WANDA è una modifica diretta di WANDA
- Rialloca il budget di mantenimento per riga attraverso i neuroni di output basandosi sull'informazione di Fisher empirica
- Il segnale di Fisher viene raccolto in un passaggio all'indietro aggiuntivo sul corpus di calibrazione di WANDA
- Nessun peso viene aggiornato
- Su LLAMA-2-7B con sparsità del 50%, la perplessità WikiText-2 è 6.85
- Migliora il 5-shot MMLU di +1.6 pp rispetto a WANDA e +1.1 pp rispetto a SPARSEGPT
- Usa un terzo del tempo di potatura e dell'energia di SPARSEGPT
- Non richiede dati di calibrazione aggiuntivi o fine-tuning
Entità
Istituzioni
- arXiv