Catena di Pensiero Visivo: Insegnare ai VLM a Vedere e Pensare Meglio con Token Visivi Continui
È stato presentato un nuovo framework chiamato Chain-of-Visual-Thought (COVT) per migliorare le capacità percettive dei modelli visione-linguaggio (VLM). Sebbene i VLM siano abili nel ragionamento linguistico, incontrano difficoltà con compiti che richiedono una percezione visiva complessa, come il ragionamento spaziale e la comprensione geometrica. Questa lacuna deriva dalla loro inadeguata capacità di catturare dati visivi densi attraverso varie dimensioni spaziali. COVT consente ai VLM di ragionare sia con il linguaggio che con token visivi continui—rappresentazioni latenti concise che trasmettono informazioni percettive ricche. Con un'allocazione modesta di circa 20 token, COVT estrae informazioni da specialisti visivi leggeri, comprendendo aspetti come l'aspetto 2D, la geometria 3D e la struttura dei bordi. Il framework è descritto in un articolo su arXiv (arXiv:2511.19418v3), che probabilmente presenta risultati sperimentali sull'efficacia di COVT, sebbene metriche di performance specifiche non siano dettagliate nell'abstract. Questo avanzamento è cruciale per l'intelligenza artificiale, specialmente nella visione artificiale e nell'apprendimento multimodale, poiché affronta una limitazione riconosciuta nella funzionalità dei VLM.
Fatti principali
- Chain-of-Visual-Thought (COVT) è un nuovo framework per i modelli visione-linguaggio (VLM).
- COVT consente ai VLM di ragionare attraverso token visivi continui, non solo parole.
- Il framework utilizza circa 20 token per distillare conoscenza da esperti visivi leggeri.
- COVT cattura proprietà complementari: aspetto 2D, geometria 3D, layout spaziale e struttura dei bordi.
- Durante l'addestramento, il VLM predice autoregressivamente token visivi per ricostruire segnali di supervisione densi.
- I segnali di supervisione includono profondità, segmentazione, bordi e caratteristiche DINO.
- L'articolo è disponibile su arXiv con identificativo arXiv:2511.19418v3.
- Il tipo di annuncio è 'replace-cross'.
Entità
Istituzioni
- arXiv