Gli Oracoli di Attivazione Sviluppano Punti Ciechi Specifici per Concetto
Uno studio recente pubblicato su arXiv (2607.23379) indica che gli Oracoli di Attivazione (AO)—modelli linguistici progettati per interpretare le attivazioni interne di un altro modello—possono presentare punti ciechi specifici per determinati concetti. In uno scenario regolamentato di Indovinello di Parole Tabù, i modelli soggetto sono stati aggiustati per utilizzare internamente un concetto nascosto astenendosi dal rivelarlo direttamente. Sorprendentemente, gli AO messi a punto hanno agito come anti-lettori, faticando costantemente a recuperare il concetto che era stato costante durante il loro addestramento. Questa scoperta suggerisce che gli AO non funzionano come interpreti imparziali; piuttosto, la loro performance è influenzata dai dati di addestramento e dagli obiettivi a cui sono esposti.
Fatti principali
- Gli Oracoli di Attivazione sono modelli linguistici addestrati per rispondere a domande sulle attivazioni interne di un altro modello.
- Lo studio utilizza un ambiente controllato di Indovinello di Parole Tabù.
- I modelli soggetto sono stati messi a punto per utilizzare internamente un concetto nascosto evitando la divulgazione diretta.
- Gli AO messi a punto possono diventare anti-lettori specifici per concetto.
- Gli AO falliscono selettivamente nel recuperare il concetto presente durante il loro addestramento.
- Gli AO sono plasmati dai dati di addestramento e dagli obiettivi, non sono letture neutre.
- L'articolo è su arXiv con ID 2607.23379.
- La ricerca evidenzia limitazioni nell'uso degli AO per l'interpretabilità.
Entità
Istituzioni
- arXiv