ARMDIL: Ensemble Eterogenei Instradati da MLLM per una Classificazione di Immagini Robusta su Più Dataset
Un nuovo studio su arXiv (2608.13463) introduce ARMDIL, un router adattivo per la classificazione di immagini multi-dominio che utilizza LLM. Questo sistema avanzato presenta un agente multimodale basato su un grande modello linguistico (MLLM) che assegna in modo intelligente le immagini al backbone visivo più adatto tra una vasta gamma di reti neurali convoluzionali (come ResNet), apprendimento auto-supervisionato (SSL) e modelli visione-linguaggio (VLM). Questi modelli sono costruiti su uno spazio di etichette unificato creato da diversi dataset di immagini con caratteristiche distinte. I risultati mostrano che ARMDIL gestisce efficacemente i compromessi tra varie architetture, rivaleggiando con router che si basano su addestramento specializzato. La ricerca evidenzia i punti di forza e i limiti di ciascuna architettura in diversi contesti visivi, affrontando la sfida dei modelli di classificazione delle immagini che eccellono in un dataset ma faticano in altri. Sfruttando più tipi di modelli, ARMDIL migliora la classificazione su più dataset.
Fatti principali
- ARMDIL è un router adattivo per la classificazione di immagini multi-dominio con LLM.
- Utilizza un agente multimodale basato su un grande modello linguistico (MLLM) per instradare le immagini verso backbone visivi adatti.
- L'insieme include ResNet, apprendimento auto-supervisionato (SSL) e modelli visione-linguaggio (VLM).
- I modelli sono addestrati su uno spazio di etichette unificato da più dataset di immagini.
- ARMDIL ottiene prestazioni competitive rispetto ai router basati su addestramento specializzato.
- L'articolo è disponibile su arXiv con ID 2608.13463.
- La ricerca affronta la generalizzazione tra domini e livelli di difficoltà.
- Le valutazioni empiriche mostrano capacità e vulnerabilità distinte di ciascuna architettura.
Entità
Istituzioni
- arXiv