FISA: Auto-aumento delle immagini basato sui fallimenti per l'auto-miglioramento dei MLLM
Un nuovo framework chiamato Failure-informed Image Self-Augmentation (FISA) è stato introdotto dai ricercatori per migliorare i modelli multimodali di grandi dimensioni (MLLM) producendo immagini aumentate basate sui propri fallimenti. Questa tecnica genera variazioni di immagine visivamente complesse ma che mantengono la risposta, valuta la loro efficacia attraverso l'autovalutazione e impiega un doppio filtraggio di fedeltà. Mira ad affrontare il costoso processo di annotazione di estesi dataset multimodali e supera gli svantaggi delle attuali strategie di auto-aumento focalizzate sul testo. La ricerca è disponibile su arXiv con l'identificatore 2608.03733.
Fatti principali
- FISA è un framework per l'auto-miglioramento dei MLLM.
- Costruisce immagini aumentate a partire dai casi di fallimento del modello stesso.
- Il metodo genera complicazioni visivamente impegnative ma che preservano la risposta.
- Verifica l'utilità attraverso l'auto-esame.
- Applica un doppio filtraggio di fedeltà.
- I metodi di auto-aumento esistenti sono in gran parte incentrati sul testo.
- L'aumento delle immagini è poco esplorato e si basa su trasformazioni generiche.
- L'articolo è su arXiv con identificatore 2608.03733.
Entità
Istituzioni
- arXiv