Il benchmark VAKRA di IBM rivela modalità critiche di fallimento degli agenti di IA negli ambienti aziendali
IBM Research ha introdotto VAKRA, un nuovo benchmark finalizzato a valutare le capacità di ragionamento e l'utilizzo di strumenti degli agenti di IA negli ambienti aziendali. Questo strumento valuta il ragionamento composizionale analizzando le tracce di esecuzione attraverso API e documenti, concentrandosi sul completamento di flussi di lavoro multi-step. VAKRA comprende oltre 8.000 API che coprono 62 diversi domini, insieme a raccolte di documenti specifici per dominio. I compiti richiedono catene di ragionamento di 3-7 passi che integrano interazioni strutturate con API con il recupero di dati non strutturati. Include quattro capacità chiave: concatenamento di API (2.077 istanze), selezione di strumenti (1.597 istanze), ragionamento multi-hop (869 istanze) e ragionamento multi-hop e multi-sorgente (644 istanze). Modelli come GPT-OSS-120B faticano, in particolare con il ragionamento complesso, rivelando discrepanze tra l'efficacia degli strumenti e l'affidabilità degli agenti per applicazioni pratiche.
Fatti principali
- VAKRA è un benchmark eseguibile e basato su strumenti per valutare gli agenti di IA
- Testa il ragionamento composizionale attraverso API e documenti utilizzando tracce di esecuzione complete
- Include oltre 8.000 API ospitate localmente supportate da database reali in 62 domini
- Comprende quattro capacità che testano diverse abilità degli agenti
- I modelli performano complessivamente male, con GPT-OSS-120B che mostra le prestazioni più forti sul concatenamento di API
- La valutazione utilizza una pipeline in stile waterfall che valuta le traiettorie degli strumenti e le risposte finali
- L'analisi dei fallimenti rivela rotture nella selezione degli strumenti, nella fornitura di argomenti e nell'accuratezza delle risposte
- Le impostazioni con vincoli di policy mostrano che i modelli faticano a incorporare vincoli esterni
Entità
Istituzioni
- arXiv
- IBM
- IBM Research
- GitHub
- Hugging Face
- OpenAI
- Google Analytics
- Tableau
- UC Berkeley