ARTFEED — Contemporary Art Intelligence

Articolo arXiv Propone Metrica Corretta per il Benchmark degli Agenti di Codifica AI

ai-technology · 2026-08-18

Un nuovo studio su arXiv (2608.14711) evidenzia un grave difetto nell'uso dell'estimatore pass@k, introdotto da Chen et al. nel 2021, per valutare gli agenti di codifica AI. Gli autori sostengono che il parametro n viene interpretato in modo errato; dovrebbe riflettere il numero di tentativi di rollout indipendenti piuttosto che i test unitari di una singola sottomissione. Questa applicazione errata porta a metriche di performance gonfiate. Propongono una nuova metrica chiamata reliability@k, dove n indica rollout indipendenti e c rappresenta i rollout completamente riusciti per coppia (task, agente). Nei test, la metrica errata aumenta falsamente i punteggi di 0.85-0.97. Introducono anche la reliability@k aggiustata per la sicurezza, che si concentra sui rollout che superano sia i test funzionali che quelli di sicurezza. Lo studio completo è disponibile su https://arxiv.org/abs/2608.14711.

Fatti principali

  • L'articolo arXiv:2608.14711 identifica un'applicazione errata dell'estimatore pass@k nei benchmark degli agenti di codifica AI.
  • Le implementazioni attuali impostano n al numero di test unitari in una singola sottomissione, non a rollout indipendenti.
  • Propone la metrica reliability@k con n = rollout indipendenti e c = rollout completamente riusciti.
  • La metrica applicata erroneamente gonfia i punteggi di 0.85-0.97 in valore assoluto (0.96-0.98 vs 0.00-0.12 corretto).
  • Il proxy a singolo rollout ha una correlazione di Spearman di 0.417, sostituto insufficiente.
  • Introduce la reliability@k aggiustata per la sicurezza che conta solo i rollout che superano i test funzionali e di sicurezza.
  • Autori: ricercatori (nomi non forniti nella fonte).
  • Pubblicato su arXiv, server di preprint.

Entità

Istituzioni

  • arXiv

Fonti