Harness-IF: Nuovo Benchmark Valuta il Seguito delle Istruzioni negli Agenti di Codifica
I ricercatori hanno introdotto Harness-IF, un nuovo benchmark progettato per valutare le capacità di seguire le istruzioni negli agenti di codifica, valutando singole regole operative sulla base di prove di esecuzione. Il benchmark comprende 60 elementi di codifica multi-turno realistici derivati da una libreria di 642 regole, con 256 regole che ricevono verdetti su cinque superfici di istruzione configurabili che gli agenti distribuiti leggono. Per distinguere la conformità genuina dal comportamento casuale, il team ha sviluppato Against-Prior Accuracy (AP-Acc), che si concentra su regole che si oppongono ai comportamenti predefiniti non richiesti, determinati rieseguendo i compiti senza la regola su nove build di prova. I test su 12 modelli all'avanguardia hanno rivelato una precisione compresa tra il 72,1% e l'85,9%, mentre i punteggi AP-Acc erano più bassi, tra il 66,1% e il 78,6%. In particolare, ogni modello ha ottenuto risultati peggiori sulle regole against-prior, con un calo medio di 5,81 punti (intervallo 3,6-7,4), e questa tendenza è persistita nelle configurazioni comuni. Lo studio evidenzia che i benchmark esistenti spesso confondono il seguire le regole con il comportamento predefinito, poiché le regole sono tipicamente concentrate nei turni dell'utente e i benchmark enfatizzano il successo finale del compito. Harness-IF affronta questa lacuna isolando l'aderenza alle regole, fornendo una misura più precisa del seguire le istruzioni. I risultati sottolineano la sfida di garantire che gli agenti di codifica seguano realmente le istruzioni, in particolare quando queste istruzioni entrano in conflitto con i comportamenti predefiniti. La ricerca è disponibile su arXiv con l'identificatore 2608.11727.
Fatti principali
- Harness-IF è un nuovo benchmark per valutare il seguito delle istruzioni negli agenti di codifica
- Valuta le regole operative una alla volta sulla base di prove di esecuzione
- Il benchmark include 60 elementi di codifica multi-turno realistici da una libreria di 642 regole
- 256 regole ricevono verdetti su cinque superfici di istruzione configurabili
- Against-Prior Accuracy (AP-Acc) separa la conformità dalla coincidenza
- AP-Acc utilizza nove build di prova con regole omesse per osservare i comportamenti predefiniti
- Sono stati testati 12 modelli all'avanguardia, con precisione compresa tra il 72,1% e l'85,9%
- I punteggi AP-Acc variavano dal 66,1% al 78,6%
- Tutti i modelli hanno ottenuto risultati peggiori sulle regole against-prior, con un calo da 3,6 a 7,4 punti (media 5,81)
- La ricerca è disponibile su arXiv con l'identificatore 2608.11727
Entità
Istituzioni
- arXiv