L'affidabilità dei LLM varia significativamente con parafrasi che preservano il significato
Uno studio recente pubblicato su arXiv (2607.22554) esamina le reazioni dei modelli linguistici di grandi dimensioni (LLM) a domande parafrasate che mantengono il loro significato. I ricercatori hanno analizzato 13 modelli su quattro benchmark e hanno scoperto che, sebbene l'accuratezza complessiva rimanga relativamente stabile, il comportamento a livello di singola istanza è incoerente. I modelli spesso passano da risposte corrette a errate in base a come vengono formulate le domande, con tassi di disallineamento superiori al 23%. Inoltre, concentrandosi sulle risposte inizialmente corrette, i tassi di fallimento sono ancora più pronunciati, suggerendo che l'accuratezza di un singolo prompt non è una misura affidabile delle prestazioni.
Fatti principali
- Lo studio esamina il comportamento dei LLM sotto parafrasi che preservano il significato.
- Sono stati testati quattro benchmark e 13 modelli.
- I tassi di disallineamento delle risposte a livello di istanza superano il 23%.
- La correttezza di un singolo prompt è un indicatore di affidabilità scarso.
- L'accuratezza complessiva cambia modestamente tra le parafrasi.
- I tassi di inversione delle risposte sono più alti per le domande inizialmente corrette.
- I compiti includono QA fattuale e ragionamento matematico.
- Le uscite del modello dipendono dalla formulazione esatta del prompt.
Entità
—