Agent Retrieval Bench: Benchmarking per il Recupero del Contesto del Repository per Agenti di Codifica
Il preprint arXiv 2607.24882 presenta Agent Retrieval Bench, un benchmark progettato per valutare la fase iniziale di recupero degli agenti di codifica, che consiste nell'identificare i file pertinenti del repository prima della generazione di patch. Questo benchmark è derivato da segnali autentici del flusso di lavoro di codifica e utilizza repository statici basati su commit di base, determinando la rilevanza in base alle esigenze immediate dell'agente piuttosto che alla similarità semantica. Presenta quattro compiti di recupero positivo: code2test, comment2context, trace2code e edit2ripple, insieme a un quinto sottoinsieme per il recupero selettivo che include casi naturali senza gold e controlli controfattuali di repository sbagliati. Il dataset consiste di 427 campioni provenienti da 25 repository, inclusi 345 casi positivi, 50 casi naturali senza gold e 32 controlli controfattuali, insieme a un corpus di 308 commit di base.
Fatti principali
- Agent Retrieval Bench è un benchmark a livello di file per il recupero del contesto degli agenti di codifica.
- I campioni sono costruiti da segnali reali del flusso di lavoro di codifica.
- La rilevanza è definita da ciò di cui un agente ha bisogno successivamente, non dalla similarità semantica.
- Quattro compiti di recupero positivo: code2test, comment2context, trace2code, edit2ripple.
- Un quinto sottoinsieme valuta il recupero selettivo con casi senza gold e controlli controfattuali.
- Il dataset contiene 427 campioni in 25 repository.
- Include 345 esempi positivi, 50 esempi naturali senza gold, 32 controlli controfattuali.
- Il corpus include 308 commit di base.
Entità
Istituzioni
- arXiv