ARTFEED — Contemporary Art Intelligence

CARVE: Compressione dei Token Senza Addestramento per la Comprensione di Volumi Medici 3D

ai-technology · 2026-08-06

Un recente preprint su arXiv presenta CARVE (Cross-Slice Anisotropic Reallocation of Visual Evidence), un framework che non richiede addestramento per comprimere i token visivi per la comprensione di volumi medici 3D in modelli linguistici multimodali basati su fette (MLLM). Catalogato come arXiv:2608.04515v1, questo lavoro affronta i problemi legati alla rappresentazione di volumi 3D come sequenze di fette 2D, che comporta un eccesso di token visivi. I ricercatori hanno scoperto che i token sovrapposti producono rendimenti decrescenti; aumentare il budget di token comporta costi più elevati mentre la precisione si stabilizza. Propongono una strategia di allocazione selettiva del budget piuttosto che una semplice espansione. A differenza delle tecniche attuali per immagini 2D, CARVE si concentra sulla riduzione della ridondanza lungo l'asse di profondità, riallocando le evidenze visive attraverso le fette per minimizzare il numero di token senza sacrificare le prestazioni, migliorando così l'efficienza nell'imaging medico.

Fatti principali

  • CARVE è un framework senza addestramento per comprimere i token visivi nella comprensione di volumi medici 3D.
  • L'articolo è disponibile su arXiv con identificativo 2608.04515v1.
  • I MLLM basati su fette rappresentano volumi 3D come sequenze di fette 2D, generando migliaia di token visivi.
  • Le analisi di scaling su due benchmark di VQA medica 3D mostrano rendimenti decrescenti: la precisione satura mentre i costi aumentano.
  • Migliorare la risoluzione nel piano è più efficace che aggiungere più fette a budget comparabili.
  • I metodi esistenti di compressione dei token sono progettati per immagini 2D o video, non per la ridondanza lungo l'asse di profondità.
  • CARVE affronta la ridondanza derivante da contenuti quasi duplicati lungo l'asse di profondità.
  • Il framework mira ad allocare il budget di token visivi in modo più selettivo.

Entità

Istituzioni

  • arXiv

Fonti