ARTFEED — Contemporary Art Intelligence

ConfBench: Nuovo Benchmark per la Calibrazione di Modelli Visione-Linguaggio nell'Estrazione di Documenti

ai-technology · 2026-08-04

Un team di ricercatori ha lanciato ConfBench, il primo benchmark dedicato alla calibrazione nell'estrazione di informazioni chiave (KIE) utilizzando modelli visione-linguaggio (VLM). Questo benchmark affronta il problema dei punteggi di confidenza affidabili nell'elaborazione intelligente dei documenti (IDP), dove i modelli devono decidere se automatizzare l'estrazione o rimandarla all'analisi umana. I benchmark precedenti hanno principalmente presentato campioni puliti e di alta qualità, risultando in aree a bassa accuratezza insufficienti per la valutazione della calibrazione. ConfBench è stato creato implementando 20 pipeline di degradazione controllata su una collezione variegata di documenti, producendo 1.346 varianti e oltre 70.000 valutazioni a livello di entità su tutta la gamma di accuratezza. Lo studio valuta quattro VLM proprietari e tre a peso aperto utilizzando metodi di stima della confidenza verbalizzati e log-probabilità su tre tipi di input. I risultati principali indicano: (i) la modalità OCR+Immagine produce stime di confidenza più precise; (ii) la capacità del modello è l'influenza primaria, con la qualità della confidenza che aumenta costantemente con la capacità all'interno della famiglia Claude. L'articolo di ricerca è disponibile su arXiv con l'identificatore 2608.01792.

Fatti principali

  • 1. ConfBench è il primo benchmark specifico per la calibrazione nell'estrazione di informazioni chiave (KIE).
  • 2. È stato creato applicando 20 pipeline di degradazione controllata a un insieme eterogeneo di documenti.
  • 3. Il benchmark include 1.346 varianti e oltre 70.000 valutazioni a livello di entità.
  • 4. Sono stati valutati quattro modelli visione-linguaggio proprietari e tre a peso aperto.
  • 5. Sono stati testati due metodi di stima della confidenza: verbalizzato e log-probabilità.
  • 6. Sono state confrontate tre modalità di input.
  • 7. La modalità OCR+Immagine porta a stime di confidenza più accurate.
  • 8. La capacità del modello è il fattore dominante nella qualità della confidenza, scalando monotonicamente all'interno della famiglia Claude.

Entità

Istituzioni

  • arXiv

Fonti