EyExIn: Iniezione Profonda di Esperti Ancorata alla Conoscenza del Dominio per VLM Retinici
Un gruppo di ricercatori ha sviluppato un nuovo framework chiamato EyExIn per affrontare alcuni problemi importanti dei Large Vision Language Models (LVLM) utilizzati per diagnosticare malattie oculari. Hanno identificato due problemi principali: il Perception Gap, in cui i modelli non rilevano segni minuscoli di malattia come i microaneurismi, e il Reasoning Gap, in cui i bias linguistici possono oscurare gli indizi visivi. EyExIn utilizza un metodo chiamato Deep Expert Injection e un sistema di codifica Expert-Aware Dual-Stream. Questo separa i dati visivi in un flusso generale per i dettagli anatomici e uno specializzato per la conoscenza esperta. Puoi consultare questa ricerca su arXiv, con il riferimento 2603.07131v4.
Fatti principali
- EyExIn affronta il Perception Gap e il Reasoning Gap nei LVLM retinici.
- Perception Gap: gli encoder visivi generali falliscono su sottili indizi patologici come i microaneurismi.
- Reasoning Gap: le priorità linguistiche prevalgono sulle prove visive nei livelli più profondi del trasformatore.
- EyExIn utilizza un meccanismo di Deep Expert Injection.
- Architettura: codifica Expert-Aware Dual-Stream.
- Il flusso generale gestisce il contesto anatomico.
- Il flusso specializzato gestisce la conoscenza specifica del dominio.
- Pubblicato su arXiv con ID 2603.07131v4.
Entità
Istituzioni
- arXiv