LENS: Scomposizione delle Rappresentazioni dei Modelli Visione-Linguaggio
Uno studio recente presenta LENS (Local Explanation of Neighborhood Subspaces), una tecnica che utilizza una Miscela di Analizzatori di Fattori per scomporre le attivazioni dei modelli visione-linguaggio (VLM) in vicinanze gaussiane locali a basso rango. Questo approccio supera gli svantaggi dei metodi di interpretabilità lineare globale, che spesso trascurano rappresentazioni localmente a bassa dimensionalità. Applicato a LLaVA-1.5-7B e Qwen3-VL-8B, LENS scopre percorsi di fusione unici dipendenti dalla profondità: LLaVA integra le modalità negli strati successivi, mentre Qwen3-VL inizia la miscelazione precocemente, ri-segrega parzialmente e poi ricombina vicino all'output. Una pipeline automatizzata per l'etichettatura multimodale fornisce descrizioni semantiche per queste vicinanze. La ricerca è disponibile su arXiv con ID 2608.00561.
Fatti principali
- LENS scompone le attivazioni dei VLM in vicinanze gaussiane locali a basso rango
- Utilizza una Miscela di Analizzatori di Fattori
- Applicato a LLaVA-1.5-7B e Qwen3-VL-8B
- Rivela traiettorie di fusione dipendenti dalla profondità
- LLaVA mescola le modalità negli strati successivi
- Qwen3-VL mescola precocemente, ri-segrega e ricombina
- Pipeline automatizzata di etichettatura multimodale assegna descrizioni semantiche
- Articolo disponibile su arXiv con ID 2608.00561
Entità
Istituzioni
- arXiv