Interpretabilità Interna: Contrazione e Propagazione nei Transformer
Uno studio recente presenta il concetto di interpretabilità interna, offrendo una visione basata sulla propagazione di come sono strutturati i modelli interni, applicato specificamente ai Transformer tabulari attraverso il rollout dell'attenzione. I ricercatori definiscono il rollout come un operatore stocastico per righe che cattura la propagazione guidata dall'attenzione tra i token delle caratteristiche. Utilizzando la classica teoria della contrazione di Doeblin–Dobrushin, dimostrano che un operatore di rollout con un coefficiente di Dobrushin minimo assomiglia molto a una matrice stocastica di rango uno, dove la riga condivisa è definita dalle sue somme di colonna normalizzate. Questa scoperta fornisce una comprensione strutturale del profilo di propagazione del rollout associato. Nei Transformer progettati per prevedere l'età metabolomica, la contrazione osservata del rollout aumenta con la profondità, suggerendo una migliore organizzazione interna.
Fatti principali
- L'interpretabilità interna è una prospettiva basata sulla propagazione dell'organizzazione interna del modello.
- È istanziata per i Transformer tabulari utilizzando il rollout dell'attenzione.
- Il rollout è interpretato come un operatore stocastico per righe che codifica la propagazione mediata dall'attenzione.
- La teoria della contrazione di Doeblin–Dobrushin è applicata agli operatori di rollout.
- Un piccolo coefficiente di Dobrushin implica vicinanza a una matrice stocastica di rango uno.
- La riga comune della matrice di rango uno è determinata dalle somme di colonna normalizzate.
- Nei Transformer per la previsione dell'età metabolomica, la contrazione del rollout si rafforza con la profondità.
Entità
Istituzioni
- arXiv