Nuova legge di scaling prevede le prestazioni dei VLM dalle capacità testuali degli LLM
Un recente articolo pubblicato su arXiv introduce la Capability-Driven Multimodal Scaling Law, un nuovo framework volto a prevedere le prestazioni dei modelli visione-linguaggio (VLM) basandosi sulle capacità testuali direttamente misurabili dei loro modelli linguistici di grandi dimensioni (LLM) di base. Questa ricerca affronta il problema di come scegliere appropriatamente i backbone LLM per lo sviluppo di VLM, una scelta attualmente arbitraria. Il framework deriva un punteggio di capacità a bassa dimensionalità dai benchmark testuali degli LLM utilizzando la PCA, modellando le prestazioni dei VLM in relazione a questo punteggio, tenendo conto dei tassi di trasferimento e assorbimento per l'efficienza dei dati. Per testare questo framework, sono stati addestrati oltre 150 VLM su 34 LLM appartenenti a 7 famiglie di modelli, valutati su più di 200 benchmark testuali e 50 multimodali. L'articolo è disponibile su arXiv con ID 2608.00013, offrendo un approccio prezioso per la comunità AI per prevedere le prestazioni dei VLM prima dell'addestramento, conservando così risorse e aiutando nella selezione dei modelli.
Fatti principali
- Propone la Capability-Driven Multimodal Scaling Law
- Prevede le prestazioni dei VLM dalle capacità testuali degli LLM
- Usa la PCA per estrarre un punteggio di capacità dai benchmark testuali
- Addestrati oltre 150 VLM su 34 LLM provenienti da 7 famiglie di modelli
- Valutati su più di 200 benchmark testuali e 50 multimodali
- Articolo disponibile su arXiv con ID 2608.00013
- Affronta la mancanza di un framework basato su principi per la selezione del backbone LLM nei VLM
- Il framework include tassi di trasferimento e tassi di assorbimento
Entità
Istituzioni
- arXiv