Studio sul Priming di Ripetizione Rivela Elaborazione Divergente nei Modelli Base e Istruiti
Una recente indagine pubblicata su arXiv (2608.14681) esamina il modo in cui i modelli linguistici di grandi dimensioni (LLM) gestiscono le parole ripetute, contrapponendo modelli base, modelli istruiti e risposte umane. Utilizzando il concetto psicologico di priming di ripetizione, lo studio valuta 15 modelli provenienti da cinque diverse famiglie (che vanno da 1,5B a 14B parametri) attraverso compiti di categorizzazione semantica e completamento di cloze, insieme a esperimenti umani comparabili. I risultati indicano che i modelli base dimostrano un'elaborazione automatica, mostrando una facilitazione immediata stabile attraverso diversi intervalli, che persiste parzialmente anche quando il contesto viene rimosso e si allinea con l'attenzione alle istanze precedenti. Al contrario, i modelli istruiti rivelano un'elaborazione controllata, dove la facilitazione diminuisce con l'intervallo, fallisce senza contesto anticipato e si sposta verso l'interferenza su scala più ampia. In particolare, all'interno della famiglia Qwen 2.5, questa dissociazione aumenta con la dimensione del modello, implicando che il post-addestramento modifica i meccanismi di elaborazione intrinseci. Questa ricerca fa luce sulla gestione delle parole ripetute da parte degli LLM e sugli effetti del tuning istruzionale su funzioni simili a quelle cognitive.
Fatti principali
- Lo studio applica il priming di ripetizione a 15 modelli appartenenti a cinque famiglie di modelli (1,5B-14B parametri).
- Sono stati utilizzati due compiti: categorizzazione semantica e completamento di cloze.
- Sono stati condotti esperimenti umani abbinati con stimoli identici.
- I modelli base mostrano elaborazione automatica: facilitazione immediata stabile attraverso gli intervalli.
- I modelli istruiti mostrano elaborazione controllata: la facilitazione decade con l'intervallo e crolla senza contesto.
- I modelli istruiti si invertono in interferenza su scala più ampia.
- All'interno della famiglia Qwen 2.5, la dissociazione aumenta con la scala del modello.
- Il post-addestramento cambia il comportamento predefinito negli LLM.
Entità
Istituzioni
- arXiv