Le rappresentazioni della verità nei LLM cambiano con il contesto
Uno studio recente pubblicato su arXiv (2601.06599) esplora i diversi modi in cui i modelli linguistici di grandi dimensioni (LLM) codificano la verità quando viene introdotto un contesto aggiuntivo. I ricercatori hanno analizzato i cambiamenti nella direzione e nell'ampiezza dei vettori di verità in quattro diversi LLM e set di dati. I loro risultati indicano che negli strati iniziali i vettori di verità sono ortogonali, convergono negli strati intermedi e potrebbero stabilizzarsi o aumentare negli strati successivi. L'inclusione del contesto tipicamente migliora la distinzione tra rappresentazioni vere e false. Inoltre, i modelli più grandi differenziano principalmente tra contesto rilevante e irrilevante attraverso alterazioni direzionali.
Fatti principali
- Lo studio esamina come i vettori di verità nei LLM cambiano con il contesto.
- Sono stati analizzati quattro LLM e quattro set di dati.
- I vettori di verità sono ortogonali negli strati iniziali, convergono in quelli intermedi.
- L'aggiunta di contesto aumenta l'ampiezza dei vettori di verità.
- I modelli più grandi utilizzano il cambiamento direzionale per filtrare il contesto rilevante.
- La ricerca proviene dall'articolo arXiv 2601.06599.
- I vettori di verità rappresentano la verità a livello di frase nelle attivazioni del flusso residuo.
- Studi precedenti hanno analizzato i vettori di verità senza contesto.
Entità
Istituzioni
- arXiv