ARTFEED — Contemporary Art Intelligence

EndoVLM: Modello Visione-Linguaggio Guidato dall'Anatomia per l'Endoscopia

ai-technology · 2026-08-06

È stato sviluppato un nuovo modello foundation visione-linguaggio chiamato EndoVLM per l'analisi di immagini endoscopiche. Questo modello innovativo è stato pre-addestrato su più di 348.000 procedure endoscopiche, collegando ogni referto clinico con il relativo set di immagini. EndoVLM utilizza un approccio di Pooling Sparso Guidato dall'Anatomia, in cui le descrizioni testuali fungono da query per migliorare l'attenzione sparsa, consentendo il consolidamento efficace di fotogrammi semanticamente rilevanti in rappresentazioni visive specifiche per l'anatomia da set di immagini sovrapposti. Successivamente, viene implementato un processo di allineamento Progressivo Semantico-Consapevole. Questa ricerca affronta la disparità tra descrizioni anatomiche strutturate e dati visivi non curati, con l'obiettivo di sfruttare le ricche intuizioni semantiche presenti nei referti clinici. Lo studio è disponibile su arXiv con l'identificatore 2608.04472.

Fatti principali

  • EndoVLM è un modello foundation visione-linguaggio per l'endoscopia.
  • Pre-addestrato su oltre 348.000 esami endoscopici.
  • Ogni esame abbina un referto clinico a una raccolta di immagini.
  • Utilizza il Pooling Sparso Guidato dall'Anatomia per aggregare i fotogrammi salienti.
  • Viene impiegato un allineamento Progressivo Semantico-Consapevole.
  • Affronta il divario di modalità tra descrizioni testuali e flussi visivi.
  • Articolo disponibile su arXiv (2608.04472).

Entità

Istituzioni

  • arXiv

Fonti