ARTFEED — Contemporary Art Intelligence

Le prove di interpretabilità dei circuiti falliscono sotto variazione analitica, secondo uno studio

ai-technology · 2026-08-17

Un nuovo studio pubblicato su arXiv (2608.13754) mette in discussione l'affidabilità dell'interpretabilità meccanica come prova per la conformità all'AI Act dell'UE. I ricercatori hanno pre-registrato una griglia di sette assi analitici, ciascuno con livelli tratti da implementazioni pubblicate, e li hanno applicati a GPT-2 small sul compito di identificazione dell'oggetto indiretto. Hanno mappato i circuiti scoperti attraverso una mappa di affermazioni deterministica per produrre dichiarazioni strutturate per l'Allegato IV. Su 15.840 specifiche pre-registrate, 7.561 hanno prodotto un'affermazione. La dichiarazione derivata si è capovolta nel 73,2% delle coppie di specifiche (IC 95% 0,725-0,738), e l'affermazione modale ha ottenuto solo il 41,1% dello spazio. Gli autori concludono che le prove di interpretabilità a livello di circuito non sopravvivono a una variazione analitica difendibile, minando il loro uso nella documentazione dei sistemi di IA ad alto rischio. Lo studio è stato annunciato come nuovo su arXiv ed è disponibile all'indirizzo https://arxiv.org/abs/2608.13754.

Fatti principali

  • Studio pubblicato su arXiv con ID 2608.13754
  • Si concentra sull'interpretabilità meccanica e sulla scoperta di circuiti
  • Valuta le prove per la documentazione dei sistemi ad alto rischio ai sensi dell'AI Act dell'UE
  • Utilizza GPT-2 small e il compito di identificazione dell'oggetto indiretto
  • Pre-registrate 15.840 specifiche su sette assi analitici
  • 7.561 specifiche hanno prodotto un'affermazione
  • La dichiarazione derivata si capovolge nel 73,2% delle coppie di specifiche (IC 95% 0,725-0,738)
  • L'affermazione modale occupa il 41,1% dello spazio

Entità

Istituzioni

  • arXiv
  • EU

Fonti