SVD a piastrelle colonnari estrae montaggi di meccanismi da siti lineari
Un nuovo articolo arXiv (2608.06969) propone un metodo per l'interpretabilità meccanicistica delle reti neurali estraendo 'montaggi di meccanismi' direttamente da siti lineari utilizzando SVD a piastrelle colonnari. Ogni montaggio è una tripla (v, u, σ) che rappresenta trigger, scrittura e forza, con identità definita come regola di peso. L'approccio è valutato su Gemma-2-2B con WikiText-2 (sottocampione di 16.384 token), valutando tutte e sette le mappe lineari. Le scritture residue (mlp.down, attn.o) ricevono voti completi A/B/C con steering dopo RMSNorm post-sublayer e superano 52/52 siti-livelli; le altre mappe (mlp.gate, attn.q, attn.k, mlp.up effettivo, attn.v) ricevono solo voti A/B, superando 26/26 ciascuna. Il punteggio aggregato è 182/182 GO. Gli autori rilasciano il codice della libreria e il dataset corrispondente. Questo lavoro sfida l'approccio dominante di addestrare dizionari proxy come gli autoencoder sparsi, che etichettano le caratteristiche dal testo a massima attivazione, localizzando invece i meccanismi nei pesi della rete stessa.
Fatti principali
- L'articolo arXiv:2608.06969 propone SVD a piastrelle colonnari per estrarre montaggi di meccanismi da siti lineari.
- Ogni montaggio è una tripla (v,u,σ) che rappresenta trigger, scrittura e forza.
- Valutazione su Gemma-2-2B con WikiText-2 (sottocampione di 16.384 token).
- Tutte e sette le mappe lineari sono valutate: le scritture residue (mlp.down, attn.o) ricevono voti completi A/B/C con steering dopo RMSNorm post-sublayer.
- Le scritture residue superano 52/52 siti-livelli.
- Le altre mappe (mlp.gate, attn.q, attn.k, mlp.up effettivo, attn.v) ricevono solo voti A/B, superando 26/26 ciascuna.
- Il punteggio aggregato è 182/182 GO.
- Il codice della libreria e il dataset sono rilasciati.
Entità
Istituzioni
- arXiv