Le prove di interpretabilità dei circuiti falliscono sotto variazione analitica, secondo uno studio
Un nuovo studio pubblicato su arXiv (2608.13754) mette in discussione l'affidabilità dell'interpretabilità meccanica come prova per la conformità all'AI Act dell'UE. I ricercatori hanno pre-registrato una griglia di sette assi analitici, ciascuno con livelli tratti da implementazioni pubblicate, e li hanno applicati a GPT-2 small sul compito di identificazione dell'oggetto indiretto. Hanno mappato i circuiti scoperti attraverso una mappa di affermazioni deterministica per produrre dichiarazioni strutturate per l'Allegato IV. Su 15.840 specifiche pre-registrate, 7.561 hanno prodotto un'affermazione. La dichiarazione derivata si è capovolta nel 73,2% delle coppie di specifiche (IC 95% 0,725-0,738), e l'affermazione modale ha ottenuto solo il 41,1% dello spazio. Gli autori concludono che le prove di interpretabilità a livello di circuito non sopravvivono a una variazione analitica difendibile, minando il loro uso nella documentazione dei sistemi di IA ad alto rischio. Lo studio è stato annunciato come nuovo su arXiv ed è disponibile all'indirizzo https://arxiv.org/abs/2608.13754.
Fatti principali
- Studio pubblicato su arXiv con ID 2608.13754
- Si concentra sull'interpretabilità meccanica e sulla scoperta di circuiti
- Valuta le prove per la documentazione dei sistemi ad alto rischio ai sensi dell'AI Act dell'UE
- Utilizza GPT-2 small e il compito di identificazione dell'oggetto indiretto
- Pre-registrate 15.840 specifiche su sette assi analitici
- 7.561 specifiche hanno prodotto un'affermazione
- La dichiarazione derivata si capovolge nel 73,2% delle coppie di specifiche (IC 95% 0,725-0,738)
- L'affermazione modale occupa il 41,1% dello spazio
Entità
Istituzioni
- arXiv
- EU