Attribuzione di Modalità Controfattuale: Nuovo Quadro per LLM Multimodali
Un nuovo quadro chiamato Attribuzione di Modalità Controfattuale (CMA) è stato sviluppato dai ricercatori per misurare quanto ciascuna modalità—immagine e testo—contribuisce alle previsioni dei modelli linguistici multimodali di grandi dimensioni (MLLM). Questa innovazione colma un vuoto significativo nell'interpretabilità, poiché le tecniche attuali possono evidenziare aree chiave dell'immagine o token di testo ma non riescono a identificare quale modalità influenza principalmente l'output di un modello. Questa distinzione è cruciale, dato che un modello può arrivare a conclusioni accurate basandosi su prove fuorvianti, il che potrebbe oscurare l'apprendimento di scorciatoie e ragionamenti non sicuri. CMA crea controfattuali per scenari solo-immagine, solo-testo e multimodali congiunti utilizzando priori di diffusione accoppiati, trasformandoli in punteggi di attribuzione di modalità attraverso un approccio cooperativo di teoria dei giochi radicato nei valori di Shapley. Questo quadro è il primo del suo genere per gli MLLM. L'articolo di ricerca è disponibile su arXiv con l'identificatore 2608.00076, e il suo abstract nota un cross-listing. Questo studio sottolinea la crescente importanza dell'interpretabilità nei sistemi di intelligenza artificiale che aiutano nel processo decisionale critico integrando informazioni diverse da varie modalità.
Fatti principali
- CMA è il primo quadro per quantificare i contributi a livello di modalità negli MLLM.
- Utilizza priori di diffusione accoppiati per generare controfattuali solo-immagine, solo-testo e multimodali congiunti.
- I punteggi di attribuzione di modalità sono derivati utilizzando i valori di Shapley dalla teoria dei giochi cooperativa.
- Il quadro affronta la questione di quale modalità guida una previsione.
- Mira a esporre l'apprendimento di scorciatoie e ragionamenti non sicuri nei modelli multimodali.
- L'articolo è disponibile su arXiv con ID 2608.00076.
- La ricerca è rilevante per applicazioni decisionali ad alto rischio.
- I metodi di interpretabilità esistenti identificano solo regioni dell'immagine o token di testo influenti, non i contributi a livello di modalità.
Entità
Istituzioni
- arXiv