ARTFEED — Contemporary Art Intelligence

BulkPR-Bench: Benchmarking della Governance a Livello di Coda delle Pull Request Interagenti

ai-technology · 2026-08-06

L'introduzione di BulkPR-Bench segna un nuovo standard per valutare la competenza degli agenti di codifica nella gestione di una coda di pull request (PR) interagenti. Questo benchmark, descritto nell'articolo arXiv 2608.02685, colma una lacuna nelle valutazioni attuali degli agenti di codifica, che spesso si concentrano su risultati isolati o sequenze di modifiche predeterminate. BulkPR-Bench sfida gli agenti a identificare relazioni significative tra le PR e a produrre un ampio sottoinsieme eseguibile in un ordine sicuro, aderendo a un protocollo di rilascio continuo. Include 581 nuove PR candidate create da snapshot congelati di 18 repository reali. Il benchmark verifica il grafo delle relazioni gold attraverso l'esecuzione stato per stato del repository, incorporando controlli di sicurezza nascosti, e impiega un oracolo esatto per determinare il più grande sottoinsieme sicuro. La metrica chiave, il Relational Delivery Score (RDS), valuta la consegna sicura e il rifiuto accurato attraverso i grafi delle relazioni, contribuendo significativamente alla governance di processi di sviluppo intricati e interattivi.

Fatti principali

  • BulkPR-Bench è un nuovo benchmark per la governance a livello di coda delle pull request interagenti.
  • È descritto nell'articolo arXiv 2608.02685.
  • Il benchmark include 581 nuove PR candidate.
  • Queste PR sono su snapshot congelati di 18 repository reali.
  • Utilizza un protocollo di rilascio continuo.
  • La metrica principale è il Relational Delivery Score (RDS).
  • Il benchmark valida il grafo delle relazioni gold tramite l'esecuzione stato per stato del repository.
  • Un oracolo esatto calcola il più grande sottoinsieme sicuro.

Entità

Istituzioni

  • arXiv

Fonti