ARTFEED — Contemporary Art Intelligence

LookBack: Un Nuovo Metodo per Valutare le Risposte LVLM Utilizzando un Riferimento Visivo

ai-technology · 2026-08-13

Un nuovo articolo di ricerca su arXiv (2608.11847v1) introduce LookBack, un metodo senza addestramento per valutare le risposte dei Large Vision-Language Models (LVLM) misurando quanto ogni token di risposta si riferisce ai token dell'immagine. Gli autori sostengono che le metriche basate sulla confidenza esistenti, adottate dai LLM, sono insufficienti per i LVLM perché catturano principalmente la plausibilità testuale piuttosto che l'accordo con l'immagine. Le loro diagnosi mostrano che rimuovere l'immagine in input cambia a malapena la selezione basata sulla confidenza. LookBack aumenta la probabilità dei token con un punteggio di lookback visivo, fornendo una misura leggera del grounding visivo. Il metodo è valutato su quattro benchmark e tre modelli, dimostrando una migliore accuratezza di valutazione. L'articolo affronta la sfida delle allucinazioni nei LVLM, dove i modelli producono risposte fluenti non ancorate all'input visivo.

Fatti principali

  • arXiv:2608.11847v1
  • Tipo di annuncio: cross
  • I Large Vision-Language Models (LVLM) integrano la percezione visiva con la generazione del linguaggio
  • I LVLM hanno allucinazioni rispetto all'immagine, producendo risposte non ancorate a ciò che vedono
  • Le metriche basate sulla confidenza esistenti dai LLM sono insufficienti per i LVLM
  • Rimuovere l'immagine in input cambia a malapena la selezione basata sulla confidenza
  • LookBack è un metodo di valutazione delle risposte LVLM senza addestramento
  • LookBack aumenta la probabilità dei token con un punteggio di lookback visivo
  • Valutato su quattro benchmark e tre modelli

Entità

Istituzioni

  • arXiv

Fonti