REVEAL: Il più grande modello generativo di base per endoscopia addestrato su 5 milioni di fotogrammi
Un innovativo modello generativo di base per l'endoscopia, chiamato REVEAL (Representation-driven Endoscopic Visual Embedding Alignment), è stato presentato dai ricercatori. Questo modello utilizza GastroNet-5M (GN-5M), un dataset completo che include 5 milioni di immagini endoscopiche provenienti da diversi centri. REVEAL colma efficacemente il divario tra immagini naturali e cliniche, mitigando al contempo gli elevati costi computazionali dell'addestramento di grandi Diffusion Transformer, utilizzando encoder specificamente pre-addestrati su dati endoscopici. Questa tecnica allinea i latenti di diffusione con caratteristiche visive uniche del dominio, garantendo la conservazione di texture dettagliate e complessi elementi anatomici. Inoltre, REVEAL funge da robusto estrattore di caratteristiche, ottenendo risultati impressionanti su diversi benchmark. Ulteriori dettagli sono disponibili in un articolo su arXiv (arXiv:2608.07176v1).
Fatti principali
- REVEAL è il più grande modello generativo di base per l'endoscopia.
- Addestrato su GastroNet-5M (GN-5M), un dataset multicentrico di 5 milioni di fotogrammi endoscopici.
- Utilizza encoder pre-addestrati sulla distribuzione endoscopica per allineare i latenti di diffusione.
- Preserva texture fini e strutture anatomiche.
- Funziona come estrattore di caratteristiche con prestazioni elevate sui benchmark.
- Articolo disponibile su arXiv con ID 2608.07176v1.
Entità
Istituzioni
- arXiv