Vero: Benchmark per la generazione verificata di codice AI a livello di repository
È stato lanciato un nuovo benchmark chiamato Vero per valutare la capacità degli agenti AI di produrre sia implementazioni che prove verificate meccanicamente delle loro specifiche in interi repository software. Questo benchmark, descritto in un articolo su arXiv (2608.13522), colma una lacuna negli attuali benchmark di verifica che di solito si concentrano su singole funzioni o sulla generazione di prove con implementazioni esistenti. Vero include 43 istanze multi-modulo derivate da repository reali in Python, Dafny, Verus e Coq, che coprono aree come protocolli crittografici e sistemi distribuiti. Ogni istanza sfida l'agente a prendere decisioni coerenti di implementazione e prova attraverso vari moduli, valutando la sua capacità di gestire codebase complessi e reali. Questo benchmark rappresenta il primo sforzo per valutare la sintesi combinata di implementazione e prova a livello di repository, con l'obiettivo di promuovere software generato da AI affidabile.
Fatti principali
- Vero è il primo benchmark per la generazione di codice verificato a livello di repository.
- Contiene 43 istanze multi-modulo da repository reali.
- Le istanze coprono Python, Dafny, Verus e Coq.
- I domini includono protocolli crittografici e sistemi distribuiti.
- Il benchmark valuta sia la sintesi dell'implementazione che quella delle prove.
- Affronta la questione aperta delle scelte coerenti tra i moduli.
- L'articolo è disponibile su arXiv con ID 2608.13522.
- Il tipo di annuncio è cross.
Entità
Istituzioni
- arXiv