ARTFEED — Contemporary Art Intelligence

DocAnnot: Framework AI accelera l'annotazione dei documenti

ai-technology · 2026-07-29

I ricercatori hanno introdotto DocAnnot, un framework che utilizza un Large Vision Language Model (LVLM), OCR e un algoritmo di corrispondenza contestuale spazialmente informata (SICM) per automatizzare la creazione di dataset di Key Information Extraction (KIE). Testato sui benchmark CORD e SROIE, ha ottenuto punteggi F1 di 0,679 e 0,846. Sebbene i dati annotati manualmente rimangano superiori, i modelli ottimizzati esclusivamente sugli output di DocAnnot hanno mostrato prestazioni rispettabili, riducendo significativamente lo sforzo manuale.

Fatti principali

  • DocAnnot utilizza LVLM, OCR e algoritmo SICM
  • SICM combina relazioni spaziali, analisi di prossimità e corrispondenza testuale
  • Valutato sui benchmark CORD e SROIE
  • Punteggi F1: 0,679 su CORD, 0,846 su SROIE
  • I dati auto-annotati possono essere utilizzati per l'ottimizzazione di modelli KIE downstream
  • I dati annotati manualmente superano ancora quelli auto-annotati
  • Il framework mira ad accelerare la generazione di dataset KIE
  • Pubblicato su arXiv con ID 2607.24745

Entità

Istituzioni

  • arXiv

Fonti