Estrazione crittanalitica di blocchi feed-forward GLU senza bias ottenuta
È stata introdotta una nuova tecnica crittanalitica per estrarre blocchi feed-forward GLU (Gated Linear Unit) isolati e senza bias da reti neurali, colmando una lacuna nelle metodologie precedenti. Questa tecnica, descritta in un articolo su arXiv (2608.06631), utilizza una primitiva di recupero multi-fase basata su query in avanti, di natura costruttiva. Identifica i candidati per la direzione del gate attraverso la curvatura alle differenze finite e distingue magnitudine del gate, orientamento e accoppiamento del ramo di valore abbinando osservazioni a x e -x. Il metodo è stato testato su target ad alta precisione, inclusi sei strati Qwen, un sottoproblema Llama con 8.192 unità e un blocco Gemma completo, tutti con un errore mediano di validazione inferiore all'uno percento. Questo avanzamento si basa su metodi di estrazione precedenti limitati a reti ReLU e a determinate funzioni di attivazione, concentrandosi specificamente sull'architettura a due rami dei blocchi GLU. L'articolo descrive in dettaglio l'algoritmo e i risultati sperimentali, rappresentando un importante passo avanti nell'interpretabilità dei modelli e nella valutazione della sicurezza.
Fatti principali
- Nuovo metodo crittanalitico estrae blocchi feed-forward GLU senza bias.
- Il metodo utilizza la curvatura alle differenze finite e osservazioni accoppiate a x e -x.
- Validato su sei strati Qwen, un sottoproblema Llama con 8.192 unità e un blocco Gemma a piena dimensionalità.
- Tutti i target hanno raggiunto un errore mediano di validazione inferiore all'uno percento.
- Estende il lavoro precedente su reti ReLU, attivazioni GELU/SiLU e matrici di proiezione finale.
- I blocchi GLU hanno una struttura a due rami non affrontata dai metodi precedenti.
- Articolo disponibile su arXiv con ID 2608.06631.
- Il metodo è una primitiva di recupero costruttiva e multi-fase basata su query in avanti.
Entità
Istituzioni
- arXiv