NaviDC-OCR: Un framework unificato per il parsing di documenti digitali e catturati da fotocamera
Un nuovo framework chiamato NaviDC-OCR è stato sviluppato da ricercatori per affrontare problemi legati al parsing di documenti, siano essi creati digitalmente o catturati tramite fotocamera. Questo sistema innovativo impiega l'apprendimento sensibile alla deformazione per migliorare la comprensione geometrica nei modelli linguistico-visivi (VLM) e introduce un metodo di campionamento adattivo per rappresentare layout complessi. Il suo obiettivo è risolvere sfide come errori a cascata derivanti da distorsioni geometriche nelle immagini da fotocamera e problemi come output ridondanti, allucinazioni e mancanza di ragionamento strutturale in contesti ad alta risoluzione. I risultati sono dettagliati in un articolo su arXiv (arXiv:2608.12898v1), classificato come annuncio di tipo incrociato, incentrato sulla conversione di documenti non strutturati in formati strutturati e leggibili da macchina, essenziali per un parsing efficace dei documenti.
Fatti principali
- NaviDC-OCR è un framework unificato per il parsing di documenti.
- Affronta sfide sia nei documenti digitali che in quelli catturati da fotocamera.
- Introduce l'apprendimento sensibile alla deformazione per incorporare la percezione geometrica nei VLM.
- Propone un meccanismo di campionamento adattivo per la rappresentazione di layout complessi.
- Mira a ridurre gli errori a cascata derivanti da distorsioni geometriche nei documenti catturati da fotocamera.
- Si concentra su generazione ridondante, allucinazioni e ragionamento strutturale insufficiente in scenari ad alta risoluzione.
- L'articolo è disponibile su arXiv con identificativo 2608.12898v1.
- La ricerca si concentra sulla trasformazione di documenti non strutturati in rappresentazioni strutturate e leggibili da macchina.
Entità
Istituzioni
- arXiv