ARTFEED — Contemporary Art Intelligence

PaDoc: Decodifica Parallela Basata sul Layout per il Parsing di Documenti

other · 2026-08-07

Un recente articolo accademico presenta PaDoc, un parser basato sul layout progettato per il parsing completo di documenti. Questa ricerca, disponibile su arXiv (2608.06146), affronta i limiti dei parser autoregressivi esistenti che convertono layout e contenuto delle pagine in un'unica sequenza, portando a lunghezze di decodifica maggiori con più contenuto. Mentre i parser a due fasi basati su ritaglio consentono l'elaborazione parallela a livello di regione, richiedono ripetuti prefill visivi e contesto frammentato. Al contrario, PaDoc considera il layout previsto come una struttura ramificata su una rappresentazione unificata della pagina, facilitando la decodifica simultanea dei rami di layout e contenuto. Ciò è realizzato attraverso una fattorizzazione condizionata dal prefisso basata su un'ipotesi di sufficienza regionale, minimizzando la profondità di decodifica al percorso layout-contenuto più lungo. L'implementazione avviene all'interno di un unico modello linguistico multimodale di grandi dimensioni (MLLM) che utilizza attenzione agli antenati a lunghezza variabile impacchettata per mantenere la visibilità durante la previsione standard del token successivo. Gli autori dell'articolo rimangono anonimi, ma la ricerca mira a migliorare l'efficienza del parsing di documenti mantenendo il contesto completo della pagina.

Fatti principali

  • PaDoc è un parser basato sul layout per il parsing di documenti.
  • Riduce la profondità di decodifica al percorso layout-contenuto più lungo.
  • Utilizza una fattorizzazione condizionata dal prefisso sotto un'ipotesi di sufficienza regionale.
  • È implementato all'interno di un unico MLLM che utilizza attenzione agli antenati a lunghezza variabile impacchettata.
  • L'articolo è disponibile su arXiv con ID 2608.06146.
  • L'articolo affronta le inefficienze dei parser di documenti end-to-end.
  • Mantiene il contesto completo della pagina consentendo la decodifica parallela.
  • Il metodo è progettato per migliorare l'efficienza rispetto ai parser a due fasi basati su ritaglio.

Entità

Istituzioni

  • arXiv

Fonti