ARTFEED — Contemporary Art Intelligence

Agent Retrieval Bench: Benchmarking per il Recupero del Contesto del Repository per Agenti di Codifica

other · 2026-07-29

Il preprint arXiv 2607.24882 presenta Agent Retrieval Bench, un benchmark progettato per valutare la fase iniziale di recupero degli agenti di codifica, che consiste nell'identificare i file pertinenti del repository prima della generazione di patch. Questo benchmark è derivato da segnali autentici del flusso di lavoro di codifica e utilizza repository statici basati su commit di base, determinando la rilevanza in base alle esigenze immediate dell'agente piuttosto che alla similarità semantica. Presenta quattro compiti di recupero positivo: code2test, comment2context, trace2code e edit2ripple, insieme a un quinto sottoinsieme per il recupero selettivo che include casi naturali senza gold e controlli controfattuali di repository sbagliati. Il dataset consiste di 427 campioni provenienti da 25 repository, inclusi 345 casi positivi, 50 casi naturali senza gold e 32 controlli controfattuali, insieme a un corpus di 308 commit di base.

Fatti principali

  • Agent Retrieval Bench è un benchmark a livello di file per il recupero del contesto degli agenti di codifica.
  • I campioni sono costruiti da segnali reali del flusso di lavoro di codifica.
  • La rilevanza è definita da ciò di cui un agente ha bisogno successivamente, non dalla similarità semantica.
  • Quattro compiti di recupero positivo: code2test, comment2context, trace2code, edit2ripple.
  • Un quinto sottoinsieme valuta il recupero selettivo con casi senza gold e controlli controfattuali.
  • Il dataset contiene 427 campioni in 25 repository.
  • Include 345 esempi positivi, 50 esempi naturali senza gold, 32 controlli controfattuali.
  • Il corpus include 308 commit di base.

Entità

Istituzioni

  • arXiv

Fonti