Livello di estrazione guidato da ontologia per la costruzione di grafi di conoscenza da documenti eterogenei
Un recente articolo su arXiv (2607.28662) descrive la creazione, l'esecuzione e il miglioramento empirico di un livello di estrazione che trasforma un flusso di documenti in tempo reale in un grafo di conoscenza validato che aderisce a un'ontologia formale. Questo sistema elabora i metadati dei documenti da Kafka, indirizzando file PDF, fogli di calcolo, Office e immagini attraverso gestori specifici, ed esegue l'estrazione di entità e relazioni in due fasi utilizzando un modello Qwen3.5-9B ospitato localmente e ottimizzato per l'ontologia. La sua caratteristica principale è l'estrazione guidata dall'ontologia, che recupera in tempo reale una parte rilevante di un'ontologia curata da un database a grafi tramite similarità di embedding, integrandola nel prompt di estrazione per la coerenza dei tipi. L'articolo affronta anche problemi come fratture nel vocabolario dei tipi, variazioni di nomi, duplicazione delle relazioni e la confusione di individui distinti con lo stesso nome, con l'obiettivo di migliorare la coerenza nello sviluppo di grafi di conoscenza per flussi di documenti eterogenei.
Fatti principali
- Articolo arXiv:2607.28662
- Utilizza il modello Qwen3.5-9B
- Consuma metadati di documenti da Kafka
- Gestisce contenuti PDF, fogli di calcolo, Office e immagini
- Processo di estrazione in due passaggi
- Estrazione guidata da ontologia tramite similarità di embedding
- Affronta fratture nel vocabolario dei tipi, varianti di nomi, duplicazione di relazioni e confusione
- Livello di estrazione in produzione per flussi di documenti in tempo reale
Entità
Istituzioni
- arXiv