ARTFEED — Contemporary Art Intelligence

LENS: Scomposizione delle Rappresentazioni dei Modelli Visione-Linguaggio

ai-technology · 2026-08-04

Uno studio recente presenta LENS (Local Explanation of Neighborhood Subspaces), una tecnica che utilizza una Miscela di Analizzatori di Fattori per scomporre le attivazioni dei modelli visione-linguaggio (VLM) in vicinanze gaussiane locali a basso rango. Questo approccio supera gli svantaggi dei metodi di interpretabilità lineare globale, che spesso trascurano rappresentazioni localmente a bassa dimensionalità. Applicato a LLaVA-1.5-7B e Qwen3-VL-8B, LENS scopre percorsi di fusione unici dipendenti dalla profondità: LLaVA integra le modalità negli strati successivi, mentre Qwen3-VL inizia la miscelazione precocemente, ri-segrega parzialmente e poi ricombina vicino all'output. Una pipeline automatizzata per l'etichettatura multimodale fornisce descrizioni semantiche per queste vicinanze. La ricerca è disponibile su arXiv con ID 2608.00561.

Fatti principali

  • LENS scompone le attivazioni dei VLM in vicinanze gaussiane locali a basso rango
  • Utilizza una Miscela di Analizzatori di Fattori
  • Applicato a LLaVA-1.5-7B e Qwen3-VL-8B
  • Rivela traiettorie di fusione dipendenti dalla profondità
  • LLaVA mescola le modalità negli strati successivi
  • Qwen3-VL mescola precocemente, ri-segrega e ricombina
  • Pipeline automatizzata di etichettatura multimodale assegna descrizioni semantiche
  • Articolo disponibile su arXiv con ID 2608.00561

Entità

Istituzioni

  • arXiv

Fonti