KnowHal: Nuovo Benchmark per la Valutazione delle Allucinazioni Multimodali
KnowHal è stato sviluppato da ricercatori come benchmark volto a valutare approfonditamente le allucinazioni nei Modelli Linguistici Multimodali di Grandi Dimensioni (MLLM). A differenza dei benchmark attuali che affrontano principalmente allucinazioni relative a entità, attributi e relazioni, KnowHal include specificamente l'allucinazione di conoscenza, che comprende quattro aree: entità, attributo, relazione e conoscenza. Questo benchmark presenta domande accoppiate—sia positive che negative—basate su immagini e entità condivise, facilitando valutazioni controllate di errori percettivi, errori di conoscenza e accettazione di premesse false. Comprende 1.800 campioni che coprono 10 domini e 50 categorie, creati attraverso un processo semi-automatizzato che integra supporto LLM, filtraggio CLIP e validazione umana. I risultati sono pubblicati in un articolo su arXiv (arXiv:2608.03782).
Fatti principali
- KnowHal è un nuovo benchmark per valutare le allucinazioni nei Modelli Linguistici Multimodali di Grandi Dimensioni (MLLM).
- Copre quattro dimensioni di allucinazione: entità, attributo, relazione e conoscenza.
- Il benchmark include 1.800 campioni in 10 domini e 50 categorie.
- Utilizza domande positive e negative accoppiate su immagini e entità condivise.
- Il processo di costruzione combina assistenza LLM, filtraggio basato su CLIP e verifica umana.
- L'articolo è disponibile su arXiv con identificatore 2608.03782.
Entità
—