ConfBench: Nuovo Benchmark per la Calibrazione di Modelli Visione-Linguaggio nell'Estrazione di Documenti
Un team di ricercatori ha lanciato ConfBench, il primo benchmark dedicato alla calibrazione nell'estrazione di informazioni chiave (KIE) utilizzando modelli visione-linguaggio (VLM). Questo benchmark affronta il problema dei punteggi di confidenza affidabili nell'elaborazione intelligente dei documenti (IDP), dove i modelli devono decidere se automatizzare l'estrazione o rimandarla all'analisi umana. I benchmark precedenti hanno principalmente presentato campioni puliti e di alta qualità, risultando in aree a bassa accuratezza insufficienti per la valutazione della calibrazione. ConfBench è stato creato implementando 20 pipeline di degradazione controllata su una collezione variegata di documenti, producendo 1.346 varianti e oltre 70.000 valutazioni a livello di entità su tutta la gamma di accuratezza. Lo studio valuta quattro VLM proprietari e tre a peso aperto utilizzando metodi di stima della confidenza verbalizzati e log-probabilità su tre tipi di input. I risultati principali indicano: (i) la modalità OCR+Immagine produce stime di confidenza più precise; (ii) la capacità del modello è l'influenza primaria, con la qualità della confidenza che aumenta costantemente con la capacità all'interno della famiglia Claude. L'articolo di ricerca è disponibile su arXiv con l'identificatore 2608.01792.
Fatti principali
- 1. ConfBench è il primo benchmark specifico per la calibrazione nell'estrazione di informazioni chiave (KIE).
- 2. È stato creato applicando 20 pipeline di degradazione controllata a un insieme eterogeneo di documenti.
- 3. Il benchmark include 1.346 varianti e oltre 70.000 valutazioni a livello di entità.
- 4. Sono stati valutati quattro modelli visione-linguaggio proprietari e tre a peso aperto.
- 5. Sono stati testati due metodi di stima della confidenza: verbalizzato e log-probabilità.
- 6. Sono state confrontate tre modalità di input.
- 7. La modalità OCR+Immagine porta a stime di confidenza più accurate.
- 8. La capacità del modello è il fattore dominante nella qualità della confidenza, scalando monotonicamente all'interno della famiglia Claude.
Entità
Istituzioni
- arXiv