Esaminata la base probatoria delle affermazioni sulle visualizzazioni da parte degli MLLM
Uno studio di arXiv indaga come i modelli linguistici multimodali di grandi dimensioni (MLLM) generano affermazioni sulle visualizzazioni di dati, analizzando 102 grafici da quattro fonti utilizzando tre MLLM (tra cui Gemini e GPT) in quattro condizioni di input. La ricerca, che ha coinvolto 1.224 descrizioni, categorizza gli output dei modelli come DIRETTI, DERIVATI o SPECULATIVI e verifica la concordanza numerica. Un contesto del grafico accessibile ha aumentato le affermazioni DIRETTE e migliorato la concordanza numerica per alcuni modelli, ma l'aggiunta di immagini non ha aiutato in modo coerente. La sezione sul Significato nel Mondo Reale è rimasta in gran parte speculativa. Lo studio evidenzia la necessità di un fondamento probatorio più chiaro nelle interpretazioni generate dagli MLLM.
Fatti principali
- Lo studio esamina le affermazioni generate dagli MLLM per le visualizzazioni di dati
- Analizzate 102 visualizzazioni da quattro fonti
- Testati tre MLLM: Gemini, GPT e un altro
- Quattro condizioni di input variano immagine, contesto e inquadramento
- Generate 1.224 descrizioni etichettate come DIRETTE, DERIVATE o SPECULATIVE
- Condotto un audit automatico della concordanza numerica
- Il contesto del grafico accessibile ha spostato Gemini e GPT verso affermazioni DIRETTE
- L'aggiunta dell'immagine al contesto completo non ha prodotto un beneficio numerico coerente
- Il prompt con contesto omesso non ha aumentato in modo affidabile il linguaggio cauto
- La sezione sul Significato nel Mondo Reale è rimasta prevalentemente SPECULATIVA
Entità
Istituzioni
- arXiv