JieZi: Dataset su larga scala e benchmark per l'esegesi dei caratteri cinesi antichi
Un nuovo compito noto come Esegesi dei Caratteri Cinesi Antichi (ACCE) è stato sviluppato dai ricercatori, concentrandosi sul question answering visivo-linguistico (VQA) per analizzare i caratteri cinesi antichi. Questo compito è suddiviso in quattro livelli: identificazione dei caratteri di base, analisi delle forme glifiche, interpretazione dei significati e studio dell'evoluzione diacronica. Per facilitare ciò, è stato creato il JieZi-Dataset, che rappresenta il primo dataset di addestramento VQA su larga scala e verificato da esperti per ACCE, includendo oltre 500.000 coppie di domande e risposte. Il dataset è stato generato attraverso un metodo che minimizza le imprecisioni fattuali sfruttando le conoscenze degli esperti. Questa iniziativa mira a colmare il divario nei dataset strutturati e nei benchmark per un esame accademico approfondito, poiché gli attuali metodi computazionali si concentrano principalmente su compiti limitati come il riconoscimento dei caratteri. L'articolo è disponibile su arXiv con l'identificatore 2608.11741.
Fatti principali
- Introduzione di ACCE, un compito VQA per l'esegesi dei caratteri cinesi antichi
- ACCE ha quattro livelli progressivi: identificazione, analisi della forma glifica, esegesi del significato, evoluzione diacronica
- JieZi-Dataset è il primo dataset di addestramento VQA su larga scala e verificato da esperti per ACCE
- JieZi-Dataset contiene oltre 500.000 coppie di domande e risposte
- Il processo di costruzione del dataset riduce gli errori fattuali limitando la generazione
- Gli approcci computazionali esistenti si concentrano su sottocompiti come riconoscimento e recupero
- Articolo disponibile su arXiv con ID 2608.11741
Entità
Istituzioni
- arXiv