LaPrune: Sparsità Differenziabile con Budget Esatto per Modelli su Scala di Milioni
C'è un nuovo studio su LaPrune, un layer unico che aiuta ad addestrare modelli sparsi rispettando un budget specifico e gestendo il secondo momento normalizzato. A differenza dei metodi tradizionali che possono disturbare i gradienti, LaPrune utilizza una barriera LapSum per la massa di selezione e un vincolo sul secondo momento normalizzato. Ciò consente una transizione dalla distribuzione uniforme della massa a selezioni top-k rigorose all'interno del budget. La tecnica garantisce precisione nel budget e fornisce solide previsioni teoriche, inclusi approfondimenti sulle frazioni sature e un solido caso peggiore per frazioni vicine allo zero. Puoi trovare questa ricerca su arXiv con ID 2608.04057 nella sezione Computer Science > Machine Learning, ed è particolarmente rilevante per applicazioni di intelligenza artificiale e machine learning.
Fatti principali
- LaPrune è un layer differenziabile per l'addestramento di modelli sparsi con controllo esatto del budget.
- Controlla il secondo momento normalizzato preservando la massa selezionata.
- Utilizza una barriera LapSum per preservare la massa di selezione.
- Un vincolo sul secondo momento normalizzato sposta la maschera da una distribuzione uniforme della massa a una top-k rigida.
- Fornisce una previsione della popolazione della frazione satura.
- Deriva una legge limite quasi binaria.
- Offre una garanzia rigorosa sul caso peggiore per la frazione vicina allo zero.
- Il parametro di durezza normalizzato è invariante rispetto alla scala dei punteggi.
- L'articolo è disponibile su arXiv con identificatore 2608.04057.
- Categorizzato sotto Computer Science > Machine Learning.
Entità
Istituzioni
- arXiv