LookBack: Un Nuovo Metodo per Valutare le Risposte LVLM Utilizzando un Riferimento Visivo
Un nuovo articolo di ricerca su arXiv (2608.11847v1) introduce LookBack, un metodo senza addestramento per valutare le risposte dei Large Vision-Language Models (LVLM) misurando quanto ogni token di risposta si riferisce ai token dell'immagine. Gli autori sostengono che le metriche basate sulla confidenza esistenti, adottate dai LLM, sono insufficienti per i LVLM perché catturano principalmente la plausibilità testuale piuttosto che l'accordo con l'immagine. Le loro diagnosi mostrano che rimuovere l'immagine in input cambia a malapena la selezione basata sulla confidenza. LookBack aumenta la probabilità dei token con un punteggio di lookback visivo, fornendo una misura leggera del grounding visivo. Il metodo è valutato su quattro benchmark e tre modelli, dimostrando una migliore accuratezza di valutazione. L'articolo affronta la sfida delle allucinazioni nei LVLM, dove i modelli producono risposte fluenti non ancorate all'input visivo.
Fatti principali
- arXiv:2608.11847v1
- Tipo di annuncio: cross
- I Large Vision-Language Models (LVLM) integrano la percezione visiva con la generazione del linguaggio
- I LVLM hanno allucinazioni rispetto all'immagine, producendo risposte non ancorate a ciò che vedono
- Le metriche basate sulla confidenza esistenti dai LLM sono insufficienti per i LVLM
- Rimuovere l'immagine in input cambia a malapena la selezione basata sulla confidenza
- LookBack è un metodo di valutazione delle risposte LVLM senza addestramento
- LookBack aumenta la probabilità dei token con un punteggio di lookback visivo
- Valutato su quattro benchmark e tre modelli
Entità
Istituzioni
- arXiv