AnchorBench: Benchmarking dell'Effetto Ancoraggio nei LLM
Un nuovo benchmark chiamato AnchorBench è stato sviluppato dai ricercatori per valutare l'effetto ancoraggio nei modelli linguistici di grandi dimensioni (LLM). Questo bias cognitivo si verifica quando un punto di riferimento iniziale influenza le valutazioni successive. Sebbene il fenomeno sia ben consolidato nel comportamento umano, recenti indagini indicano che anche i LLM possono esserne influenzati. Studi precedenti, tuttavia, si concentravano tipicamente su una gamma ristretta di percorsi di ancoraggio e non riuscivano a distinguere tra ancore pertinenti e irrilevanti. AnchorBench rimedia a ciò esaminando vari percorsi di ancoraggio lungo un asse di rilevanza definito. Il benchmark è stato valutato su quattordici modelli, inclusi dieci modelli open-weight e quattro modelli API di frontiera, utilizzando un set completo di prompt controllati. I risultati rivelano che l'ancoraggio è significativamente influenzato dal percorso, con ancore plausibili che creano spostamenti più sostanziali rispetto a quelle irrilevanti, in particolare attraverso percorsi più forti, e l'impatto diminuisce man mano che l'ancora si allontana dal suo contesto originale. Questa ricerca è disponibile su arXiv con l'identificatore 2608.14320.
Fatti principali
- AnchorBench è un nuovo benchmark per l'effetto ancoraggio nei LLM.
- Valuta molteplici percorsi di ancoraggio con un asse esplicito di rilevanza dell'ancora.
- Testato su quattordici modelli: dieci modelli open-weight e quattro modelli API di frontiera.
- I risultati mostrano che l'ancoraggio è fortemente dipendente dal percorso.
- Le ancore plausibili inducono spostamenti maggiori rispetto a quelle irrilevanti attraverso percorsi più forti.
- L'influenza dell'ancora si indebolisce man mano che l'ancora si allontana.
- L'articolo è disponibile su arXiv con ID 2608.14320.
- Lo studio utilizza un ampio set di prompt controllati.
Entità
Istituzioni
- arXiv