ARTFEED — Contemporary Art Intelligence

HERO: Un Nuovo Framework di Apprendimento per Rinforzo per la Generazione di Referti Radiologici

ai-technology · 2026-08-06

Un nuovo framework di ottimizzazione delle politiche denominato HERO (Hierarchical Evidential Reasoning Optimization) è stato sviluppato da ricercatori per migliorare la Generazione di Referti Radiologici (RRG) utilizzando Modelli Linguistici Multimodali su Larga Scala (MLLM). Questo framework affronta le difficoltà nell'allineamento degli MLLM attraverso l'apprendimento per rinforzo (RL) causate dalla variazione della supervisione medica. La tradizionale Ottimizzazione delle Politiche di Gruppo Relativa (GRPO) distribuisce il credito in modo uniforme lungo il processo di generazione, causando interferenze tra segmenti, diluizione dei token e una disconnessione tra evidenza e diagnosi, che peggiora le allucinazioni cliniche. HERO introduce un metodo di ottimizzazione delle politiche fattorizzato che allinea diverse supervisioni con tre livelli di ottimizzazione: segmento, token e completamento. Ottimizza il ragionamento, la diagnosi e il grounding delle evidenze individualmente utilizzando strategie complementari e un sistema di ricompensa diversificato che include accuratezza diagnostica, qualità del ragionamento e coerenza pensiero-risposta. Risultati promettenti sono stati osservati in esperimenti condotti sui dataset MIMIC-CXR e IU-Xray. L'articolo di ricerca è disponibile su arXiv con identificativo 2601.03321.

Fatti principali

  • HERO è un framework di ottimizzazione del ragionamento evidenziale gerarchico per la generazione di referti radiologici.
  • Affronta le sfide nell'apprendimento per rinforzo per gli MLLM nell'imaging medico.
  • La GRPO vanilla assegna un credito uniforme, portando a interferenze tra segmenti, diluizione dei token e disaccoppiamento evidenza-diagnosi.
  • HERO utilizza tre granularità di ottimizzazione: livello di segmento, token e completamento.
  • Ottimizza separatamente ragionamento, diagnosi e grounding delle evidenze.
  • La formulazione della ricompensa copre accuratezza diagnostica, qualità del ragionamento e coerenza pensiero-risposta.
  • Gli esperimenti sono stati condotti sui dataset MIMIC-CXR e IU-Xray.
  • L'articolo è disponibile su arXiv con identificativo 2601.03321.

Entità

Istituzioni

  • arXiv

Fonti