CAP: Nuovo Benchmark per Agenti Browser Cross-Site con Azioni Complesse e Percezione
È stato lanciato un nuovo standard noto come CAP per valutare gli agenti browser che eseguono compiti web simili a quelli umani su più siti, richiedendo intricate interazioni con l'interfaccia utente e comprensione visiva. Questo benchmark affronta due sfide chiave nella navigazione web reale che spesso vengono ignorate dalle valutazioni attuali: eseguire azioni complesse su interfacce utente sofisticate e percepire contenuti visivamente dinamici, in particolare nei processi che coinvolgono più siti web. CAP utilizza un approccio di decomposizione e ricomposizione, inizialmente astraendo ogni sito in una scheda di sito strutturata che incapsula le funzionalità rivolte all'utente, i compiti di esecuzione complessi e le esigenze percettive, prima di integrare questi elementi in flussi di lavoro cross-site realistici. Ogni compito si basa sulle funzionalità effettive dei siti web. Il relativo articolo è disponibile su arXiv con l'identificatore 2608.08392.
Fatti principali
- CAP è un benchmark scalabile per valutare gli agenti browser.
- Si concentra su compiti web cross-site simili a quelli umani.
- Il benchmark affronta azioni complesse su interfacce utente ricche.
- Affronta anche la percezione visiva di contenuti renderizzati dinamicamente.
- La pipeline decompone i siti web in schede di sito e li ricompone in flussi di lavoro.
- Ogni compito è basato sulla funzionalità effettiva del sito web.
- L'articolo è disponibile su arXiv con l'identificatore 2608.08392.
- Il benchmark è progettato per valutare gli agenti in flussi di lavoro che coinvolgono più siti web.
Entità
Istituzioni
- arXiv