Sonde Economiche Potrebbero Sostituire la Costosa Formazione per i Modelli Visione-Linguaggio 3D-CT
Un nuovo preprint arXiv (2607.22771) propone l'uso di sonde economiche su embedding memorizzati nella cache per valutare combinazioni di encoder e compressione di token per modelli visione-linguaggio 3D CT, evitando il costoso fine-tuning di grandi modelli linguistici. Il metodo introduce un benchmark di probing basato su immagini con famiglie di attributi clinici e due porte di convalida: scale-sanity e probe-separability. Queste porte garantiscono che gli attributi siano ben scalati e decodificabili. Lo studio confronta varie testine di lettura in un'indagine preliminare, con l'obiettivo di ridurre il carico computazionale della ricerca su molte combinazioni di encoder-compressione-budget di token.
Fatti principali
- Il preprint arXiv 2607.22771 propone sonde economiche per la valutazione di VLM 3D CT
- Le sonde utilizzano embedding memorizzati nella cache da encoder di immagini congelati
- Evita il fine-tuning di grandi modelli linguistici su ogni combinazione
- Introduce un benchmark di probing basato su immagini con famiglie di attributi clinici
- Due porte di convalida: scale-sanity e probe-separability
- Confronta una gamma di testine di lettura in uno studio preliminare
- Mira a ridurre il costo computazionale della ricerca encoder-compressione
- Si concentra su modelli visione-linguaggio per tomografia computerizzata 3D
Entità
Istituzioni
- arXiv