PreDiff-LM: L'attenzione ibrida migliora i modelli linguistici a diffusione mascherata discreta
Uno studio recente presenta PreDiff-LM, una tecnica progettata per modificare i trasformatori autoregressivi pre-addestrati per la modellazione linguistica a diffusione mascherata discreta. Il principale progresso risiede in una maschera di attenzione ibrida unica che mantiene l'attenzione causale nel prompt visibile mentre consente un'attenzione bidirezionale completa nel target mascherato. Valutata rispetto a una configurazione GPT-2 Medium abbinata su WikiText-103 con 90K passi, questo approccio ibrido migliora la perplessità incondizionata da 34,1 a 28,7 e i punteggi MAUVE da 0,71 a 0,78 rispetto all'attenzione bidirezionale uniforme con identica inizializzazione AR. Inoltre, l'adattamento dell'attenzione funziona in combinazione con un adattamento dell'obiettivo in stile DiffuGPT, raggiungendo una perplessità di 26,9. L'inizializzazione pre-addestrata riduce significativamente i passi necessari per ottenere una perplessità inferiore a 50 da circa 350K a 8K, sebbene un modello AR fine-tuned con risorse computazionali equivalenti funzioni ancora bene.
Fatti principali
- PreDiff-LM adatta i trasformatori autoregressivi pre-addestrati per la modellazione linguistica a diffusione mascherata discreta.
- La maschera di attenzione ibrida preserva l'attenzione causale nel prompt e bidirezionale nel target.
- Testato su GPT-2 Medium con WikiText-103 per 90K passi.
- Perplessità incondizionata migliorata da 34,1 a 28,7.
- MAUVE migliorato da 0,71 a 0,78.
- Combinato con l'adattamento dell'obiettivo in stile DiffuGPT raggiunge una perplessità di 26,9.
- L'inizializzazione pre-addestrata riduce i passi per una perplessità inferiore a 50 da ~350K a 8K.
- Un modello AR fine-tuned con risorse computazionali equivalenti supera ancora le prestazioni.
Entità
—