Miscalibrazione Stabile nei LLM: Errori ad Alta Confidenza Persistono Sotto Perturbazioni
Un recente articolo su arXiv (ID 2608.13591) esplora le origini degli errori ad alta confidenza nei grandi modelli linguistici, suggerendo che questi problemi possano derivare da una miscalibrazione stabile piuttosto che da un'inferenza interna instabile. I ricercatori utilizzano due metodi diagnostici: un punteggio di audit a livello di output sensibile alle etichette che valuta la variazione di confidenza tra domini e identifica errori eccessivamente fiduciosi rispetto a una linea di base a risposta forzata, insieme a una sonda di sensibilità interna che valuta i cambiamenti negli stati nascosti. In un insieme di audit fattuale binario multi-dominio, il punteggio di audit indica dove l'autocritica che tiene conto dell'astensione minimizza la perdita decisionale, sebbene le linee di base etichettate dirette mostrino una classificazione più forte dello stesso miglioramento. Il prompting autocritico riduce efficacemente la sensibilità degli stati nascosti attraverso i livelli in tre modelli a pesi aperti, supportando una stabilizzazione locale indotta dal prompt senza confermare la calibrazione.
Fatti principali
- ID dell'articolo: arXiv:2608.13591
- Tipo di annuncio: nuovo
- Focus: miscalibrazione stabile nei grandi modelli linguistici
- Due diagnostiche: punteggio di audit a livello di output e sonda di sensibilità interna
- Il punteggio di audit classifica i domini in base alla variazione di confidenza e agli errori eccessivamente fiduciosi
- Il prompting autocritico riduce la sensibilità degli stati nascosti attraverso i livelli in tre modelli a pesi aperti
- I risultati supportano la stabilizzazione locale indotta dal prompt, non solo l'astensione a livello di output
- Non implica calibrazione
Entità
Istituzioni
- arXiv