ARTFEED — Contemporary Art Intelligence

SpIn-ViT: Un Vision Transformer a Induzione di Sparsità per l'Interpretabilità Meccanicistica

ai-technology · 2026-08-18

Un nuovo framework chiamato SpIn-ViT è stato sviluppato dai ricercatori, che incorpora un meccanismo a induzione di sparsità nei Vision Transformer (ViT) per migliorare l'interpretabilità meccanicistica. A differenza degli Autoencoder Sparsi (SAE) post-hoc convenzionali che si basano su rappresentazioni statiche, SpIn-ViT consente l'addestramento congiunto di un ViT pre-addestrato insieme a un SAE modificato in modo end-to-end, garantendo che le rappresentazioni sparse a livello di patch siano allineate con l'obiettivo di classificazione delle immagini. Questo metodo produce attivazioni neuronali semanticamente significative che individuano aree importanti delle immagini, mantenendo comunque una precisione predittiva competitiva. Il framework è stato testato su nove benchmark di classificazione delle immagini, utilizzando accuratezza di classificazione, metriche di interpretabilità e valutazioni sia da revisori AI che umani. I risultati indicano che SpIn-ViT migliora la connessione tra le caratteristiche apprese e i compiti a valle, potenzialmente migliorando l'interpretabilità dei modelli di visione. L'articolo è disponibile su arXiv con l'identificatore 2608.14922.

Fatti principali

  • SpIn-ViT addestra congiuntamente un ViT pre-addestrato e un SAE modificato in modo end-to-end.
  • Il framework allinea le rappresentazioni sparse a livello di patch con la classificazione delle immagini.
  • Apprende attivazioni neuronali semanticamente coerenti che localizzano regioni significative delle immagini.
  • La valutazione è stata condotta su nove benchmark di classificazione delle immagini.
  • Le metriche utilizzate includono accuratezza di classificazione, metriche quantitative di interpretabilità, valutazioni basate su AI e umane.
  • L'articolo è disponibile su arXiv con ID 2608.14922.
  • SpIn-ViT mira a migliorare l'interpretabilità meccanicistica dei Vision Transformer.
  • L'approccio contrasta con i SAE post-hoc addestrati su rappresentazioni congelate.

Entità

Istituzioni

  • arXiv

Fonti