Gli LLM conoscono i vincoli ma non li usano: colli di bottiglia di attivazione nel ragionamento pragmatico
Uno studio recente pubblicato su arXiv (sottomissione 2608.12321) esamina le ragioni dei fallimenti dei grandi modelli linguistici (LLM) quando un segnale superficiale prominente contraddice un vincolo di fattibilità implicito. I ricercatori definiscono questo problema come 'attivazione condizionale del vincolo', distinguendo tra la comprensione interna del vincolo da parte del modello e la sua applicazione nel processo decisionale. Introducono una diagnostica in quattro parti che valuta la conoscenza (se il vincolo è codificato), la simmetria (la sua codifica uguale in prompt con e senza vincolo), il routing (l'uso del vincolo nelle decisioni finali) e la riparazione (la capacità di rettificare la decisione tramite attivazione del donatore). Testando 14 modelli emergono due modalità di fallimento distinte. Le sonde su due modelli a pesi aperti raggiungono oltre l'88% di accuratezza nel decodificare il vincolo, con il patching di attivazione che migliora un modello (+6,4 nats) mentre danneggia l'altro (-0,07 nats). Lo studio indaga anche strategie di mitigazione, concludendo che nessun intervento basato su prompt raggiunge con successo il quadrante di riparazione, poiché tutti gli interventi aumentano il bias conservativo attraverso la menzione di prerequisiti. Gli autori affermano che il fallimento del vincolo nascosto è principalmente un problema di routing piuttosto che di conoscenza. Questa ricerca rientra in Informatica > Calcolo e Linguaggio e include riferimenti, citazioni e codice e dati correlati.
Fatti principali
- L'articolo è intitolato 'Gli LLM conoscono il vincolo ma non lo usano: colli di bottiglia di attivazione nel ragionamento pragmatico sui vincoli'.
- È disponibile su arXiv con ID 2608.12321.
- Lo studio introduce il concetto di 'attivazione condizionale del vincolo'.
- Una diagnostica a quattro parti misura conoscenza, simmetria, routing e riparazione.
- Nello studio sono stati testati 14 modelli.
- Le sonde su due modelli a pesi aperti decodificano il vincolo con oltre l'88% di accuratezza.
- Il patching di attivazione ripara un modello (+6,4 nats) ma non l'altro (-0,07 nats).
- Nessun intervento basato su prompt raggiunge il quadrante di riparazione; tutti aumentano il bias conservativo tramite la menzione di prerequisiti.
- L'articolo conclude che il fallimento del vincolo nascosto è un problema di routing, non di conoscenza.
Entità
Istituzioni
- arXiv