FinProBench: Nuovo Benchmark per Agenti AI Finanziari con Rubriche Basate sui Ruoli
FinProBench è stato lanciato da ricercatori come benchmark per valutare agenti AI finanziari, utilizzando criteri basati su output professionali. A questo benchmark si accompagna la Costruzione di Rubriche Basate sui Ruoli (RGRC), una pipeline riutilizzabile che deriva rubriche di valutazione dai risultati effettivi dei professionisti in ruoli definiti. RGRC è strutturata in quattro fasi: Raccolta dei Deliverable, Estrazione delle Competenze, Sintesi delle Rubriche e Validazione. Le rubriche create tramite RGRC racchiudono standard impliciti, differenziano i livelli di qualità e sono trasferibili tra compiti all'interno di un ruolo. Nel loro studio, i ricercatori hanno classificato 57 occupazioni per tipo di deliverable in 30 ruoli convenzionali con ricca conoscenza pregressa e 27 ruoli specializzati con scarsa conoscenza pregressa. Il metodo Prompt-only si avvicina molto a RGRC per i ruoli convenzionali (89,2% rispetto al 90,7%), ma RGRC eccelle significativamente nelle categorie specializzate. L'articolo di ricerca è disponibile su arXiv con identificativo 2608.04077.
Fatti principali
- FinProBench è un nuovo benchmark per compiti finanziari professionali.
- RGRC (Costruzione di Rubriche Basate sui Ruoli) è una pipeline riutilizzabile per derivare rubriche dai deliverable dei professionisti.
- RGRC comprende quattro fasi: Raccolta dei Deliverable, Estrazione delle Competenze, Sintesi delle Rubriche e Validazione.
- Le rubriche catturano standard taciti, distinguono i livelli di qualità e si trasferiscono tra compiti all'interno di un ruolo.
- 57 occupazioni sono state classificate in 30 ruoli convenzionali e 27 ruoli specializzati.
- Il metodo Prompt-only si avvicina quasi a RGRC per i ruoli convenzionali (89,2% vs 90,7%).
- RGRC supera sostanzialmente il metodo Prompt-only per i ruoli specializzati.
- L'articolo è disponibile su arXiv con identificativo 2608.04077.
Entità
Istituzioni
- arXiv