QuoteBench: i punteggi corrispondenti nascondono i fallimenti del percorso di comando negli agenti di codifica LLM
Un nuovo standard noto come QuoteBench rivela un problema significativo nella valutazione degli agenti di codifica LLM: i punteggi di esecuzione corrispondenti possono mascherare i fallimenti del percorso di comando. Questo benchmark, descritto nell'articolo arXiv 2608.13547, valuta la transizione tra la generazione di comandi e il trasporto di esecuzione. Consiste in 56 attività one-shot provenienti da 14 famiglie di incidenti, con una precisa validazione dello stato finale. Una caratteristica chiave è un parser intenzionalmente non escapato che interseca il contratto di generazione con il trasporto di esecuzione. Nel punto di interpolazione, l'escaping riproduce i risultati del percorso grezzo di ogni risposta riprodotta, indicando che qualsiasi recupero all'interno di un confine divulgato deve derivare da cambiamenti nella generazione del modello. In otto configurazioni con la stessa finestra, riprodurre la stessa risposta attraverso il parser aggiunto comporta un calo di successo di 55,4-73,2 punti percentuali. La divulgazione recupera 30,4-60,7 punti per sei configurazioni, mentre le altre due producono risultati nulli o leggermente negativi. La generazione grezza è quasi saturata al confine, indicando che mentre i modelli attuali eccellono nei compiti grezzi, faticano quando vengono introdotte variazioni di parsing nell'ambiente di esecuzione. Questa ricerca sottolinea la necessità di valutare l'intero percorso di comando, piuttosto che concentrarsi esclusivamente sul testo generato, e offre una tecnica per distinguere gli errori di generazione dai fallimenti di esecuzione.
Fatti principali
- QuoteBench è un nuovo benchmark per valutare gli agenti di codifica LLM.
- Misura il confine tra la generazione di comandi e il trasporto di esecuzione.
- Il benchmark utilizza 56 attività one-shot provenienti da 14 famiglie derivate da incidenti.
- Viene utilizzata una validazione esatta dello stato finale per la valutazione.
- Un parser aggiunto deliberatamente non escapato viene utilizzato per testare il contratto di generazione.
- Riprodurre la stessa risposta attraverso il parser aggiunto riduce il successo di 55,4-73,2 punti percentuali.
- La divulgazione recupera 30,4-60,7 punti per sei configurazioni.
- La generazione grezza è quasi saturata al confine.
Entità
—