DocAnnot: Framework AI accelera l'annotazione dei documenti
I ricercatori hanno introdotto DocAnnot, un framework che utilizza un Large Vision Language Model (LVLM), OCR e un algoritmo di corrispondenza contestuale spazialmente informata (SICM) per automatizzare la creazione di dataset di Key Information Extraction (KIE). Testato sui benchmark CORD e SROIE, ha ottenuto punteggi F1 di 0,679 e 0,846. Sebbene i dati annotati manualmente rimangano superiori, i modelli ottimizzati esclusivamente sugli output di DocAnnot hanno mostrato prestazioni rispettabili, riducendo significativamente lo sforzo manuale.
Fatti principali
- DocAnnot utilizza LVLM, OCR e algoritmo SICM
- SICM combina relazioni spaziali, analisi di prossimità e corrispondenza testuale
- Valutato sui benchmark CORD e SROIE
- Punteggi F1: 0,679 su CORD, 0,846 su SROIE
- I dati auto-annotati possono essere utilizzati per l'ottimizzazione di modelli KIE downstream
- I dati annotati manualmente superano ancora quelli auto-annotati
- Il framework mira ad accelerare la generazione di dataset KIE
- Pubblicato su arXiv con ID 2607.24745
Entità
Istituzioni
- arXiv