I LLM addestrati per istruzioni collassano in un unico output, non riescono a campionare distribuzioni
Uno studio recente pubblicato su arXiv (2607.25292) indica che i modelli linguistici ottimizzati per le istruzioni faticano a campionare da varie distribuzioni, spesso ricadendo su una singola risposta. I ricercatori hanno valutato modelli di tre diverse famiglie con vari metodi di post-addestramento e hanno scoperto che tutti i modelli addestrati per istruzioni hanno ottenuto risultati inferiori in ogni compito, mentre i modelli base hanno mostrato significativamente meno fallimenti. È interessante notare che un modello che non riesce a campionare da una distribuzione può comunque caratterizzarla accuratamente in un'istanza, un fenomeno chiamato scissione KNOWS/DOES. Questo problema è legato a un meccanismo di campionamento difettoso. Questi risultati sollevano preoccupazioni sull'affidabilità dei LLM come sostituti dei partecipanti umani ai sondaggi nel campionamento siliconico.
Fatti principali
- I modelli addestrati per istruzioni collassano in un unico output invece di campionare da distribuzioni.
- La stessa persona sulla stessa domanda restituisce la stessa risposta in oltre la metà degli elementi in un benchmark di opinione pubblica.
- Il collasso è netto: le probabilità interne si concentrano su una singola opzione.
- L'addestramento per istruzioni amplifica il fallimento in tre famiglie di modelli.
- I modelli base falliscono molto meno spesso dei modelli addestrati per istruzioni.
- La scissione KNOWS/DOES descrive il divario tra descrivere e campionare una distribuzione.
- Il fallimento è ricondotto a un primitivo di campionamento degenerato.
- Lo studio è pubblicato su arXiv con ID 2607.25292.
Entità
Istituzioni
- arXiv