ARTFEED — Contemporary Art Intelligence

Nuova legge di scaling prevede le prestazioni dei VLM dalle capacità testuali degli LLM

ai-technology · 2026-08-04

Un recente articolo pubblicato su arXiv introduce la Capability-Driven Multimodal Scaling Law, un nuovo framework volto a prevedere le prestazioni dei modelli visione-linguaggio (VLM) basandosi sulle capacità testuali direttamente misurabili dei loro modelli linguistici di grandi dimensioni (LLM) di base. Questa ricerca affronta il problema di come scegliere appropriatamente i backbone LLM per lo sviluppo di VLM, una scelta attualmente arbitraria. Il framework deriva un punteggio di capacità a bassa dimensionalità dai benchmark testuali degli LLM utilizzando la PCA, modellando le prestazioni dei VLM in relazione a questo punteggio, tenendo conto dei tassi di trasferimento e assorbimento per l'efficienza dei dati. Per testare questo framework, sono stati addestrati oltre 150 VLM su 34 LLM appartenenti a 7 famiglie di modelli, valutati su più di 200 benchmark testuali e 50 multimodali. L'articolo è disponibile su arXiv con ID 2608.00013, offrendo un approccio prezioso per la comunità AI per prevedere le prestazioni dei VLM prima dell'addestramento, conservando così risorse e aiutando nella selezione dei modelli.

Fatti principali

  • Propone la Capability-Driven Multimodal Scaling Law
  • Prevede le prestazioni dei VLM dalle capacità testuali degli LLM
  • Usa la PCA per estrarre un punteggio di capacità dai benchmark testuali
  • Addestrati oltre 150 VLM su 34 LLM provenienti da 7 famiglie di modelli
  • Valutati su più di 200 benchmark testuali e 50 multimodali
  • Articolo disponibile su arXiv con ID 2608.00013
  • Affronta la mancanza di un framework basato su principi per la selezione del backbone LLM nei VLM
  • Il framework include tassi di trasferimento e tassi di assorbimento

Entità

Istituzioni

  • arXiv

Fonti