Modello Qwen2.5-7B esaminato per inferenze latenti sull'identità colombiana
Un recente studio pilota disponibile su arXiv (2607.21774) esplora la rappresentazione interna dell'identità colombiana, dello stato socioeconomico e dei concetti legati agli stereotipi da parte del modello linguistico di grandi dimensioni Qwen2.5-7B-Instruct quando risponde a prompt in spagnolo colombiano e inglese. I ricercatori hanno utilizzato Autoencoder di Linguaggio Naturale (NLA) per articolare le attivazioni del flusso residuo dal layer 20, analizzando 30 prompt organizzati in 15 coppie abbinate in spagnolo e inglese che includevano segnali colombiani espliciti e impliciti, oltre a controlli neutri. I risultati forniscono tassi descrittivi e approfondimenti qualitativi piuttosto che risultati statisticamente significativi, con l'obiettivo di determinare se le rappresentazioni latenti di nazionalità o stereotipi si manifestano prima di essere espresse nell'output del modello. Questa ricerca collega l'interpretabilità a livello di attivazione con la valutazione dei bias in contesti linguistici e culturali sottorappresentati.
Fatti principali
- Lo studio esamina Qwen2.5-7B-Instruct per inferenze latenti sull'identità colombiana
- Utilizza Autoencoder di Linguaggio Naturale (NLA) per verbalizzare le attivazioni del flusso residuo
- Analizza il layer 20 in quattro quartili posizionali per ogni prompt
- Il dataset contiene 30 prompt in 15 coppie abbinate spagnolo-inglese
- I prompt includono segnali colombiani espliciti, impliciti e controlli neutri
- Riporta tassi descrittivi e prove qualitative, non effetti statisticamente significativi
- Si concentra sul fatto che le rappresentazioni latenti di nazionalità o stereotipi appaiano prima della verbalizzazione
- Collega l'interpretabilità a livello di attivazione con la valutazione dei bias
Entità
Istituzioni
- arXiv
- Qwen2.5-7B-Instruct
Luoghi
- Colombia