ARTFEED — Contemporary Art Intelligence

LLM Multi-Modali per la Trascrizione di Documenti Manoscritti Multi-Pagina

ai-technology · 2026-08-10

Uno studio recente pubblicato su arXiv (2502.20295) esplora l'applicazione di modelli linguistici di grandi dimensioni multi-modali (MLLM) nella trascrizione di documenti manoscritti che si estendono su più pagine. La ricerca affronta le difficoltà associate al riconoscimento della scrittura a mano (HTR), evidenziando che i metodi attuali spesso richiedono una messa a punto su dataset etichettati, che può essere poco pratica, o si affidano a soluzioni zero-shot come motori OCR e MLLM. Sebbene gli MLLM abbiano potenziale come trascrittori end-to-end e post-processori OCR, mancano studi empirici che valutino varie tecniche di prompting per HTR, in particolare per documenti con più pagine. L'articolo sottolinea che la maggior parte dei testi manoscritti sono multi-pagina e condividono elementi contestuali come contenuto semantico e stile di scrittura, ma gli MLLM sono generalmente applicati a livello di pagina, trascurando questo contesto condiviso. Nota anche che gli MLLM sono tipicamente utilizzati o come post-processori solo testo o come soluzioni OCR solo immagine, piuttosto che integrare più modalità. La ricerca introduce una serie di metodi che combinano OCR, post-processing LLM e prompting MLLM per migliorare l'accuratezza della trascrizione. Questo articolo è stato marcato come replace-cross su arXiv, indicando una revisione, ed è pertinente a campi come le digital humanities, la digitalizzazione archivistica e la trascrizione assistita da IA di documenti storici.

Fatti principali

  • ID dell'articolo: arXiv:2502.20295
  • Tipo di annuncio: replace-cross
  • Focus: Trascrizione di documenti manoscritti multi-pagina
  • Metodi: Combinazione di OCR, post-processing LLM e prompting MLLM
  • Problema: Gli approcci HTR esistenti richiedono messa a punto o si affidano a strumenti zero-shot
  • Osservazione: Gli MLLM sono tipicamente usati a livello di pagina, ignorando il contesto condiviso tra pagine
  • Osservazione: Gli MLLM sono usati o come post-processori solo testo o come alternative OCR solo immagine
  • Obiettivo: Valutare diverse strategie di prompting MLLM per HTR

Entità

Istituzioni

  • arXiv

Fonti