Potenziamento Guidato dall'Attivazione per la Fusione di Modelli su Scale Diverse
Un nuovo studio su arXiv (2608.13596) introduce un metodo chiamato Activation-Prune-Merge (APM) che consente il trasferimento di conoscenze da un grande modello linguistico a uno più piccolo senza alcun addestramento. Questo approccio crea mappe di attivazione specifiche dal modello più grande, individua strati cruciali, dimensioni nascoste, teste di attenzione e neuroni MLP, e poi li pota per adattarli alla struttura del modello più piccolo. Utilizza anche un coefficiente di interpolazione micro nell'output finale. Questa tecnica migliora le prestazioni del modello più piccolo senza richiedere un allineamento diretto a livello di neuroni. Gli autori sottolineano l'importanza di affrontare scenari cross-scale nella fusione di modelli, dove i modelli differiscono in vari aspetti. Menzionano anche che semplicemente ridurre un modello grande e incorporare un piccolo peso di miscelazione può giovare al modello più piccolo, cosa che APM utilizza.
Fatti principali
- Il documento arXiv:2608.13596 introduce Activation-Prune-Merge (APM).
- APM è un framework senza addestramento per la fusione di modelli su scale diverse.
- Trasferisce conoscenze da un modello donatore grande a un modello ricevente più piccolo.
- Il metodo utilizza mappe di attivazione per potare il donatore per adattarlo all'architettura del ricevente.
- Inietta la fetta del donatore con un coefficiente di interpolazione micro.
- Non è richiesto un allineamento semantico esplicito a livello di neuroni.
- Affronta la fusione di modelli eterogenei con disallineamento architetturale.
- Il documento è disponibile su arXiv.
Entità
Istituzioni
- arXiv