Il Compito di Conflitto LLM Rivela Percorsi di Elaborazione Distinti nei Modelli Gemma-2 e Pythia
Un nuovo studio introduce un compito di conflitto solo verbale per i modelli linguistici di grandi dimensioni (LLM), rivelando percorsi di elaborazione distinti che gestiscono condizioni congruenti e incongruenti. La ricerca, disponibile su arXiv (2608.11510), testa Gemma-2-2B e sei modelli Pythia (da 410M a 12B parametri) utilizzando uno stelo di prompt che elicita un completamento predefinito dello stesso colore, con una regola esplicita che concorda (congruente) o confligge (incongruente) con tale completamento. I risultati mostrano forti tendenze predefinite allo stesso colore in tutti i modelli, e sei dei sette modelli mostrano robusti effetti di congruenza. Attraverso l'analisi di attribuzione causale, l'analisi dell'attenzione e le ablazioni dell'attenzione, gli autori hanno identificato due percorsi distinti: uno che coinvolge l'attenzione a corto raggio su un segnale di colore superficiale, attivato preferenzialmente nella condizione congruente, e un altro che coinvolge l'attenzione a lungo raggio sul prefisso della regola, attivo nella condizione incongruente. Questo lavoro estende lo studio degli effetti di congruenza, tradizionalmente esplorati in psicologia e neuroscienze tramite i compiti di Stroop e flanker, al dominio degli LLM, offrendo approfondimenti meccanicistici su come questi modelli elaborano informazioni conflittuali. I risultati contribuiscono a una comprensione più profonda dei meccanismi interni degli LLM, potenzialmente informando la progettazione e la valutazione di modelli futuri.
Fatti principali
- Lo studio introduce un compito di conflitto LLM solo verbale.
- Il compito utilizza uno stelo di prompt che elicita un completamento predefinito dello stesso colore.
- Una regola esplicita concorda (congruente) o confligge (incongruente) con il completamento.
- Sono stati testati Gemma-2-2B e sei modelli Pythia (da 410M a 12B parametri).
- Tutti i modelli hanno mostrato forti tendenze predefinite allo stesso colore.
- Sei dei sette modelli hanno mostrato forti effetti di congruenza.
- Sono state utilizzate l'analisi di attribuzione causale, l'analisi dell'attenzione e le ablazioni dell'attenzione.
- Sono stati identificati due percorsi di elaborazione distinti: attenzione a corto raggio sul segnale di colore (congruente) e attenzione a lungo raggio sul prefisso della regola (incongruente).
Entità
—