ARTFEED — Contemporary Art Intelligence

Incertezza Verbalizzata per il Rinvio Controllato del Rischio in Modelli Linguistici di Piccole Dimensioni

other · 2026-08-06

Un recente preprint su arXiv (2608.05064) esplora il ruolo della fiducia espressa nel facilitare il rinvio controllato del rischio per piccoli modelli linguistici open-weight, che vengono utilizzati sempre più frequentemente in ambienti privati, offline e sensibili al budget. La ricerca valuta undici modelli istruiti da tre diverse categorie, con dimensioni dei parametri che vanno da 0,5B a 14B, su ARC-Challenge e TruthfulQA, generando 25.168 previsioni locali. Gli autori presentano tre risultati teorici chiave: la calibrazione monotona stretta mantiene la frontiera rischio-copertura e l'AUROC di rilevamento degli errori; lo scaling della temperatura è inefficace per modelli con fiducia superiore alla metà mentre l'accuratezza diminuisce; e un metodo Clopper-Pearson trasforma un dataset di calibrazione di 200 domande in un certificato di rischio a campione finito sotto l'assunzione i.i.d. In particolare, otto delle 22 combinazioni modello-compito hanno raggiunto il limite di inapplicabilità dello scaling della temperatura all'interno dei parametri dello studio. L'articolo è accessibile su arXiv con l'identificatore 2608.05064.

Fatti principali

  • L'articolo è arXiv:2608.05064, annunciato come sottomissione cross-type.
  • Studia la fiducia verbalizzata per il rinvio controllato del rischio in piccoli modelli linguistici.
  • Sono stati valutati undici modelli istruiti da tre famiglie, con dimensioni da 0,5B a 14B parametri.
  • Le valutazioni sono state condotte su ARC-Challenge e TruthfulQA.
  • Sono state generate un totale di 25.168 previsioni locali.
  • Vengono presentati tre risultati teorici: la calibrazione monotona preserva la frontiera rischio-copertura e l'AUROC; lo scaling della temperatura non può calibrare certi modelli; la procedura Clopper-Pearson fornisce certificati di rischio a campione finito.
  • Empiricamente, otto delle 22 coppie modello-compito hanno raggiunto il limite di inapplicabilità dello scaling della temperatura.
  • L'articolo è disponibile su https://arxiv.org/abs/2608.05064.

Entità

Istituzioni

  • arXiv

Fonti