RepoProbe: Nuovo Benchmark per la Comprensione del Codice a Livello di Repository con LLM
RepoProbe, un nuovo benchmark, è stato lanciato per valutare la comprensione dei modelli linguistici di grandi dimensioni (LLM) riguardo a interi repository software. Questo benchmark è descritto in un articolo disponibile su arXiv (2608.04783) e affronta le carenze delle attuali tecniche di valutazione che dipendono dai report di bug di GitHub Issues, che spesso consentono ai modelli di fare affidamento sul riconoscimento di pattern piuttosto che sulla vera comprensione. Invece, RepoProbe utilizza domande aperte da GitHub Discussions per valutare la comprensione architetturale piuttosto che limitarsi a identificare difetti. Inoltre, l'articolo introduce un protocollo di verifica basato su checklist volto a migliorare la coerenza del punteggio LLM-as-a-Judge, che attualmente mostra una variabilità significativa e una bassa chiarezza. La ricerca sottolinea il problema del 'Edit Bias', in cui i modelli suggeriscono modifiche al codice senza comprendere appieno la struttura esistente. Questo benchmark mira a spostare l'attenzione dalla generazione a livello di funzione al supporto a livello di repository, offrendo una valutazione più completa degli LLM in scenari di ingegneria del software.
Fatti principali
- RepoProbe è un nuovo benchmark per valutare la comprensione del codice a livello di repository.
- Utilizza domande aperte da GitHub Discussions invece dei report di bug.
- Il benchmark affronta l' 'Edit Bias' nella generazione di codice da parte degli LLM.
- Viene proposto un protocollo di verifica basato su checklist per la valutazione.
- I benchmark esistenti si basano su GitHub Issues, che consentono il pattern matching.
- Il punteggio scalare LLM-as-a-Judge ha alta varianza e bassa interpretabilità.
- L'articolo è disponibile su arXiv con ID 2608.04783.
- L'attenzione è su domande architetturali piuttosto che sulla segnalazione di difetti.
Entità
Istituzioni
- arXiv
- GitHub