Il framework CAPS colma il divario di policy agentica nella compressione visione-testo
Una recente sottomissione su arXiv (2608.08960) presenta CAPS, un framework a due stadi per l'auto-distillazione di policy agentica cross-modale, volto a colmare il divario di policy agentica nella compressione visione-testo per agenti linguistici multi-step. Lo studio rivela che, sebbene convertire le storie di interazione in immagini riduca i costi di contesto, introduce anche un divario di capacità non attribuibile esclusivamente alla qualità dell'OCR. Gli autori hanno condotto valutazioni controllate sul recupero della storia, sulle decisioni a stato corrispondente e su traiettorie complete, scoprendo che gli agenti con storia visiva mostrano una deriva costante nella selezione delle azioni, nella formulazione delle query, nell'arresto e nell'uso delle prove. CAPS sfrutta la policy di storia testuale più robusta dello stesso modello per guidare la sua equivalente con storia visiva, con l'auto-distillazione di traiettorie offline che migliora il comportamento della policy testuale per input con storia visiva, integrata dall'auto-distillazione di policy online per ulteriori miglioramenti.
Fatti principali
- Il documento arXiv:2608.08960v1 introduce il framework CAPS
- CAPS sta per Auto-distillazione di policy agentica cross-modale
- Affronta il divario di policy agentica nella compressione visione-testo
- La compressione visione-testo riduce i costi di contesto per gli agenti linguistici
- Il divario non può essere spiegato solo dalla qualità dell'OCR
- Gli agenti con storia visiva mostrano una deriva sistematica nella selezione delle azioni, nella formulazione delle query, nell'arresto e nell'uso delle prove
- L'auto-distillazione di traiettorie offline trasferisce il comportamento della policy testuale agli input visivi
- L'auto-distillazione di policy online fa parte del framework a due stadi
Entità
Istituzioni
- arXiv