ARTFEED — Contemporary Art Intelligence

Il framework CAPS colma il divario di policy agentica nella compressione visione-testo

ai-technology · 2026-08-11

Una recente sottomissione su arXiv (2608.08960) presenta CAPS, un framework a due stadi per l'auto-distillazione di policy agentica cross-modale, volto a colmare il divario di policy agentica nella compressione visione-testo per agenti linguistici multi-step. Lo studio rivela che, sebbene convertire le storie di interazione in immagini riduca i costi di contesto, introduce anche un divario di capacità non attribuibile esclusivamente alla qualità dell'OCR. Gli autori hanno condotto valutazioni controllate sul recupero della storia, sulle decisioni a stato corrispondente e su traiettorie complete, scoprendo che gli agenti con storia visiva mostrano una deriva costante nella selezione delle azioni, nella formulazione delle query, nell'arresto e nell'uso delle prove. CAPS sfrutta la policy di storia testuale più robusta dello stesso modello per guidare la sua equivalente con storia visiva, con l'auto-distillazione di traiettorie offline che migliora il comportamento della policy testuale per input con storia visiva, integrata dall'auto-distillazione di policy online per ulteriori miglioramenti.

Fatti principali

  • Il documento arXiv:2608.08960v1 introduce il framework CAPS
  • CAPS sta per Auto-distillazione di policy agentica cross-modale
  • Affronta il divario di policy agentica nella compressione visione-testo
  • La compressione visione-testo riduce i costi di contesto per gli agenti linguistici
  • Il divario non può essere spiegato solo dalla qualità dell'OCR
  • Gli agenti con storia visiva mostrano una deriva sistematica nella selezione delle azioni, nella formulazione delle query, nell'arresto e nell'uso delle prove
  • L'auto-distillazione di traiettorie offline trasferisce il comportamento della policy testuale agli input visivi
  • L'auto-distillazione di policy online fa parte del framework a due stadi

Entità

Istituzioni

  • arXiv

Fonti