LiNC: Un metodo leggero per correggere il rumore delle etichette nei dataset di imaging medico
Un nuovo approccio per affrontare il rumore delle etichette nei dataset di imaging medico è stato condiviso in un preprint su arXiv. Questo rumore, che può derivare da cose come differenze tra i valutatori, errori di etichettatura e casi ambigui, rappresenta un rischio per l'efficacia dei modelli di machine learning in contesti clinici. La tecnica si chiama Lightweight Noise Correction (LiNC) e introduce un singolo parametro di fiducia regolabile per ogni esempio di addestramento. Aiuta il modello a capire quando fidarsi dell'etichetta data rispetto alle proprie previsioni durante l'addestramento. Combinando l'etichetta effettiva con le previsioni del modello, ottimizza i livelli di fiducia sia per i dati puliti che per quelli rumorosi, utilizzando un modello di miscela gaussiana a 3 componenti per la correzione. Puoi consultare l'articolo su arXiv con ID 2608.04147.
Fatti principali
- Il rumore delle etichette è comune nei dataset di imaging medico a causa della variabilità tra i valutatori, errori di annotazione e casi ambigui.
- LiNC aggiunge un singolo parametro di fiducia addestrabile per ogni campione di addestramento.
- Il metodo impara quando usare l'etichetta osservata e quando fare affidamento sul modello durante un ciclo di addestramento standard.
- L'addestramento utilizza una combinazione convessa dell'etichetta osservata e della distribuzione predittiva del modello, controllata dal parametro di fiducia per campione.
- Il gradiente dell'obiettivo spinge i valori di fiducia in direzioni opposte per campioni puliti rispetto a quelli rumorosi nella fase iniziale di addestramento.
- Un modello di miscela gaussiana a 3 componenti viene utilizzato per separare le distribuzioni di fiducia.
- L'articolo è disponibile su arXiv con identificatore 2608.04147.
- Il metodo mira a migliorare l'affidabilità e l'efficacia clinica dei modelli di machine learning addestrati su dataset rumorosi.
Entità
Istituzioni
- arXiv