GDPevo: Nuovo Benchmark per Valutare l'Auto-Evoluzione degli Agenti AI in Compiti Aziendali
Un nuovo benchmark chiamato GDPevo è stato lanciato da ricercatori per valutare le capacità di auto-evoluzione degli agenti AI all'interno di flussi di lavoro aziendali di valore. Questo benchmark, descritto in un articolo su arXiv (2608.03764), supera le carenze delle attuali tecniche di valutazione offrendo un'ampia copertura dei domini di attività, garantendo che i miglioramenti durante i test derivino dall'addestramento e riducendo i rischi di contaminazione dei dati. GDPevo si concentra sui flussi di lavoro legati al PIL ed è prodotto tramite una pipeline di dati completamente automatizzata. Il suo metodo principale, l'ibridazione delle regole, scompone i flussi di lavoro in regole aziendali di base, assegna queste regole ai compiti di addestramento e le riassembla per i test per collegare direttamente i guadagni di prestazione all'addestramento. La prima versione V1 presenta 120 compiti divisi in 12 categorie, influenzando la ricerca sugli agenti AI fornendo un quadro di valutazione più efficace per agenti auto-evolventi in scenari aziendali pratici.
Fatti principali
- GDPevo è un benchmark per valutare l'auto-evoluzione degli agenti AI.
- Si basa su flussi di lavoro aziendali legati al PIL.
- Il benchmark utilizza l'ibridazione delle regole per scomporre i flussi di lavoro in regole aziendali atomiche.
- I compiti di addestramento e test sono progettati in modo che i guadagni in fase di test siano attribuibili all'esperienza di addestramento.
- GDPevo copre flussi di lavoro CRM, ERP, finanza, sanità, legale e data-centrici.
- La versione V1 contiene 120 compiti in 12 gruppi.
- Il benchmark è generato da una pipeline di dati completamente automatizzata.
- Affronta la contaminazione dei dati e la copertura limitata nei benchmark esistenti.
Entità
Istituzioni
- arXiv