CARGO-VL: Nuovo Quadro per Modelli Visione-Linguaggio Affidabili
Uno studio recente presenta CARGO-VL, un framework volto a migliorare l'affidabilità dei modelli visione-linguaggio risolvendo le discrepanze tra evidenze testuali e visive. Questo articolo, disponibile su arXiv (2608.04509), propone una strategia di ottimizzazione relativa al gruppo che consolida vari stati di evidenza—allineati, immagine-corretta, testo-corretto, e entrambi-errati—in un pacchetto unificato. Integra l'accuratezza condizionale con ricompense di transizione per ottenere invarianza delle risposte, equivarianza delle fonti, e il passaggio da risposte all'astensione. Per gestire le risposte rischiose contro l'eccessivo rinvio, viene impiegato un controllore primale-duale. Inoltre, gli autori introducono XMC (eXtended Modal Conflict), uno strumento di addestramento con quattro scenari di conflitto, e valutano le capacità di trasferimento utilizzando i benchmark CMC-Bench e Modality-Bias. Questo framework mira ad aiutare i modelli a riconoscere fonti affidabili e ad astenersi dal rispondere quando le evidenze sono insufficienti, affrontando un problema significativo nell'IA multimodale.
Fatti principali
- CARGO-VL è un framework relativo al gruppo per modelli visione-linguaggio.
- Ottimizza varianti abbinate che coprono stati di evidenza allineati, immagine-corretta, testo-corretto, ed entrambi-errati.
- L'obiettivo combina l'accuratezza condizionale con ricompense di transizione.
- Un controllore primale-duale bilancia risposte non sicure contro l'eccessivo rinvio.
- XMC (eXtended Modal Conflict) è una risorsa di addestramento al conflitto a quattro condizioni.
- La valutazione viene eseguita su CMC-Bench e Modality-Bias.
- L'articolo è disponibile su arXiv con ID 2608.04509.
- Il framework affronta i cambiamenti di evidenza controfattuali nei sistemi visione-linguaggio.
Entità
Istituzioni
- arXiv