Quantificazione dell'incertezza adattata alla traiettoria per agenti LLM
Un recente preprint su arXiv (2608.11552) esplora l'applicazione di tecniche di quantificazione dell'incertezza (UQ) a turno singolo a interazioni multi-turno che coinvolgono modelli linguistici di grandi dimensioni (LLM). La ricerca valuta tre metodologie UQ: scorer white-box che analizzano le probabilità dei token di azione, scorer di coerenza black-box basati su dati ricampionati e scorer riflessivi che dipendono dall'autovalutazione del modello. Lo studio esamina cinque LLM e quattro dataset da BFCL-v4 e τ²-bench. I risultati rivelano che, sebbene questi metodi possano essere utili, potrebbero non essere sempre affidabili; di conseguenza, approcci UQ su misura sono essenziali per gestire efficacemente gli errori decisionali degli LLM.
Fatti principali
- ID del paper: arXiv:2608.11552v1
- Tipo di annuncio: cross
- Valuta tre famiglie di metodi UQ: probabilità dei token white-box, coerenza black-box, autovalutazione riflessiva
- Testato su cinque LLM e quattro dataset di uso di strumenti multi-turno
- Dataset da BFCL-v4 e τ²-bench
- Le probabilità dei token sono sensibili alla scelta dell'aggregatore
- I punteggi riflessivi forniscono prestazioni elevate
- Il trasferimento della UQ a turno singolo agli agenti multi-turno è irregolare
Entità
Istituzioni
- arXiv
- BFCL-v4
- τ²-bench