ARTFEED — Contemporary Art Intelligence

RoRA: Un Nuovo Metodo Senza Addestramento per il Potatura dei Token Visivi nei LLM Multimodali

ai-technology · 2026-08-10

C'è un nuovo studio su arXiv (2608.07088) che introduce RoRA, che sta per Role-Oriented Regional Allocation. Questo framework mira a semplificare la potatura dei token visivi per i modelli linguistici di grandi dimensioni multimodali (MLLM) senza la necessità di addestramento. Tipicamente, gli MLLM utilizzano lunghe sequenze di token visivi, che possono essere piuttosto dispendiose in termini di risorse per il pre-filling e lo storage della cache KV. Mentre i metodi di potatura esistenti si concentrano sull'importanza e la diversità dei token, spesso trascurano come scegliere quali token mantenere e non tengono traccia delle aree già coperte. RoRA adotta un approccio innovativo categorizzando i token in un nucleo protetto, contesto complementare e segmenti dettagliati all'interno di un budget prestabilito. Questo metodo ottimizza i meccanismi di attenzione e mira a migliorare le prestazioni degli MLLM in modo efficiente.

Fatti principali

  • RoRA è un framework senza addestramento per la potatura dei token visivi negli MLLM.
  • Partiziona i token in nucleo semantico protetto, contesto complementare e dettaglio a grana fine.
  • Utilizza prior posizionale e prior dell'oggetto calibrato dal prompt per calibrare l'attenzione condizionata dal testo.
  • Le Regioni Ancorate all'Attenzione (AAR) sono costruite da ancore ad alta confidenza.
  • Il contesto viene esplorato principalmente al di fuori delle AAR, con un piccolo budget guidato dalle AAR per i dettagli locali.
  • L'articolo è disponibile su arXiv con ID 2608.07088.
  • Il metodo mira a ridurre il costo computazionale negli MLLM.
  • È un articolo cross-listed (tipo di annuncio: cross).

Entità

Istituzioni

  • arXiv

Fonti