ARTFEED — Contemporary Art Intelligence

Allineamento Multimodale Progressivo per l'Addestramento Continuo su Istruzioni

ai-technology · 2026-07-30

Esiste un nuovo framework chiamato Allineamento Multimodale Progressivo (PMA) che affronta un problema noto come dimenticanza a livello di proiettore nell'Addestramento Continuo su Istruzioni Multimodali (MCIT). Nei Modelli Linguistici Multimodali di Grandi Dimensioni (MLLM), un proiettore collega i dati visivi al linguaggio. Tuttavia, quando i dati visivi cambiano e il significato delle istruzioni si sposta, il proiettore può derivare. PMA rileva questi cambiamenti utilizzando un semplice descrittore di rappresentazione e aggiunge nuovi esperti di proiettore solo quando necessario. Utilizza anche un router espandibile per combinare gli output degli esperti basati su caratteristiche multimodali, mantenendo il proiettore preaddestrato originale come riferimento stabile. Questo approccio aiuta ad adattare continuamente il proiettore senza perdere allineamenti precedenti, colmando una lacuna nei metodi esistenti che si concentrano principalmente sul backbone LLM.

Fatti principali

  • PMA affronta la dimenticanza a livello di proiettore in MCIT
  • I MLLM si basano su un proiettore per la comprensione cross-modale
  • Le distribuzioni visive mutevoli causano la deriva del proiettore
  • PMA utilizza un descrittore di rappresentazione leggero
  • PMA espande progressivamente gli esperti del proiettore
  • Un router espandibile integra gli output degli esperti
  • Il proiettore preaddestrato originale viene mantenuto come ancoraggio
  • PMA consente un adattamento continuo preservando l'allineamento

Entità

Fonti