Articolo arXiv Propone Metrica Corretta per il Benchmark degli Agenti di Codifica AI
Un nuovo studio su arXiv (2608.14711) evidenzia un grave difetto nell'uso dell'estimatore pass@k, introdotto da Chen et al. nel 2021, per valutare gli agenti di codifica AI. Gli autori sostengono che il parametro n viene interpretato in modo errato; dovrebbe riflettere il numero di tentativi di rollout indipendenti piuttosto che i test unitari di una singola sottomissione. Questa applicazione errata porta a metriche di performance gonfiate. Propongono una nuova metrica chiamata reliability@k, dove n indica rollout indipendenti e c rappresenta i rollout completamente riusciti per coppia (task, agente). Nei test, la metrica errata aumenta falsamente i punteggi di 0.85-0.97. Introducono anche la reliability@k aggiustata per la sicurezza, che si concentra sui rollout che superano sia i test funzionali che quelli di sicurezza. Lo studio completo è disponibile su https://arxiv.org/abs/2608.14711.
Fatti principali
- L'articolo arXiv:2608.14711 identifica un'applicazione errata dell'estimatore pass@k nei benchmark degli agenti di codifica AI.
- Le implementazioni attuali impostano n al numero di test unitari in una singola sottomissione, non a rollout indipendenti.
- Propone la metrica reliability@k con n = rollout indipendenti e c = rollout completamente riusciti.
- La metrica applicata erroneamente gonfia i punteggi di 0.85-0.97 in valore assoluto (0.96-0.98 vs 0.00-0.12 corretto).
- Il proxy a singolo rollout ha una correlazione di Spearman di 0.417, sostituto insufficiente.
- Introduce la reliability@k aggiustata per la sicurezza che conta solo i rollout che superano i test funzionali e di sicurezza.
- Autori: ricercatori (nomi non forniti nella fonte).
- Pubblicato su arXiv, server di preprint.
Entità
Istituzioni
- arXiv