PaDoc: Decodifica Parallela Basata sul Layout per il Parsing di Documenti
Un recente articolo accademico presenta PaDoc, un parser basato sul layout progettato per il parsing completo di documenti. Questa ricerca, disponibile su arXiv (2608.06146), affronta i limiti dei parser autoregressivi esistenti che convertono layout e contenuto delle pagine in un'unica sequenza, portando a lunghezze di decodifica maggiori con più contenuto. Mentre i parser a due fasi basati su ritaglio consentono l'elaborazione parallela a livello di regione, richiedono ripetuti prefill visivi e contesto frammentato. Al contrario, PaDoc considera il layout previsto come una struttura ramificata su una rappresentazione unificata della pagina, facilitando la decodifica simultanea dei rami di layout e contenuto. Ciò è realizzato attraverso una fattorizzazione condizionata dal prefisso basata su un'ipotesi di sufficienza regionale, minimizzando la profondità di decodifica al percorso layout-contenuto più lungo. L'implementazione avviene all'interno di un unico modello linguistico multimodale di grandi dimensioni (MLLM) che utilizza attenzione agli antenati a lunghezza variabile impacchettata per mantenere la visibilità durante la previsione standard del token successivo. Gli autori dell'articolo rimangono anonimi, ma la ricerca mira a migliorare l'efficienza del parsing di documenti mantenendo il contesto completo della pagina.
Fatti principali
- PaDoc è un parser basato sul layout per il parsing di documenti.
- Riduce la profondità di decodifica al percorso layout-contenuto più lungo.
- Utilizza una fattorizzazione condizionata dal prefisso sotto un'ipotesi di sufficienza regionale.
- È implementato all'interno di un unico MLLM che utilizza attenzione agli antenati a lunghezza variabile impacchettata.
- L'articolo è disponibile su arXiv con ID 2608.06146.
- L'articolo affronta le inefficienze dei parser di documenti end-to-end.
- Mantiene il contesto completo della pagina consentendo la decodifica parallela.
- Il metodo è progettato per migliorare l'efficienza rispetto ai parser a due fasi basati su ritaglio.
Entità
Istituzioni
- arXiv