ARTFEED — Contemporary Art Intelligence

Un framework AI agentico migliora il rilevamento del glaucoma dalla fotografia del fundus

ai-technology · 2026-08-11

È stato creato un nuovo framework per l'AI agentica che unisce modelli linguistici di grandi dimensioni (LLM) con tecnologie di deep learning mirate per migliorare il rilevamento del glaucoma tramite fotografia del fundus. Questo framework affronta problemi chiave associati agli LLM, come allucinazioni, accuratezza incoerente e variabilità tra esecuzioni. Il processo si svolge in tre fasi: un LLM effettua una valutazione iniziale, vengono attivati strumenti specializzati per valutare la qualità dell'immagine (QAModel, FundaQ-8), classificare il glaucoma (SwinV2-Tiny) e segmentare il disco/cupa ottica (SegFormer-B0), seguito da una fase di riflessione in cui l'LLM combina la sua valutazione iniziale con gli output degli strumenti. La valutazione è avvenuta su due dataset pubblici, ORIGA (n=100) e RIM-ONE-v3 (n=100), utilizzando sia viste ritagliate che non ritagliate. Il test ha coinvolto due LLM, Gemini 2.5 Flash e GPT-5.4 mini, con tutte le immagini valutate da uno specialista del glaucoma mascherato. Il framework agentico ha migliorato l'accuratezza della classificazione di 16-47 punti percentuali su entrambi i dataset. Questo studio, identificato come arXiv:2608.07651, illustra un percorso promettente per migliorare l'affidabilità degli LLM nell'interpretazione di immagini mediche, potenzialmente portando a strumenti diagnostici più precisi e coerenti in oftalmologia.

Fatti principali

  • Il framework AI agentico integra LLM con strumenti di deep learning specializzati per il rilevamento del glaucoma.
  • Il flusso di lavoro include valutazione iniziale dell'LLM, chiamata di funzioni per strumenti specializzati e riflessione dell'LLM.
  • Strumenti utilizzati: QAModel, FundaQ-8 per la qualità dell'immagine; SwinV2-Tiny per la classificazione del glaucoma; SegFormer-B0 per la segmentazione del disco/cupa ottica.
  • Due LLM valutati: Gemini 2.5 Flash e GPT-5.4 mini.
  • Dataset: ORIGA (n=100) e RIM-ONE-v3 (n=100).
  • Le immagini sono state valutate da uno specialista del glaucoma mascherato con formazione specifica.
  • L'accuratezza della classificazione è migliorata di 16-47 punti percentuali.
  • Lo studio è disponibile su arXiv con ID 2608.07651.

Entità

Istituzioni

  • arXiv

Fonti