ARTFEED — Contemporary Art Intelligence

Elaborazione Visiva Disaccoppiata: Adattamento Multimodale Efficiente tramite Sostituzione di Blocchi Transformer Specifici per Modalità

ai-technology · 2026-07-30

I ricercatori hanno introdotto un metodo di addestramento innovativo chiamato Elaborazione Visiva Disaccoppiata (DVP) per modelli linguistici di grandi dimensioni multimodali (MLLM). Questo approccio sostituisce gli strati superiori del decoder di un modello linguistico pre-addestrato con un blocco transformer più efficiente, addestrabile separatamente e dedicato alla gestione dei token visivi. Nella prima metà del decoder, i token visivi e testuali vengono elaborati insieme, ma poi si separano: i token visivi passano attraverso il nuovo blocco transformer, mentre quelli testuali continuano attraverso gli strati originali. Questo design riduce i costi computazionali non richiedendo la messa a punto di tutti i parametri, poiché le rappresentazioni visive e testuali divergono negli strati successivi. Maggiori informazioni sono fornite in un articolo su arXiv (2607.26596).

Fatti principali

  • 1. DVP sostituisce gli strati superiori del decoder con un singolo blocco transformer per i token visivi.
  • 2. I token visivi e testuali vengono separati dopo la prima metà degli strati del decoder.
  • 3. Il metodo riduce il costo computazionale per la messa a punto delle istruzioni visive.
  • 4. L'articolo è disponibile su arXiv con ID 2607.26596.
  • 5. DVP è un framework di addestramento efficiente per MLLM.
  • 6. L'approccio sfrutta la divergenza delle rappresentazioni visive e testuali negli strati più profondi.
  • 7. Il nuovo blocco transformer è leggero e addestrabile indipendentemente.
  • 8. Il framework evita di mettere a punto tutti i parametri del modello.

Entità

Istituzioni

  • arXiv

Fonti