OurBench: Nuovo Benchmark per il Debugging di SQL Aziendale con LLM
È stato introdotto un nuovo benchmark chiamato OurBench per valutare la capacità degli LLM di eseguire il debugging di codice SQL a livello aziendale. A differenza dei benchmark text-to-SQL esistenti, che si concentrano sulla generazione di SQL corretto in un unico tentativo, OurBench si rivolge al processo di debugging iterativo, più realistico per complesse attività di ingegneria dei dati aziendali. Il benchmark comprende 469 query con errori di sintassi (OurBenchSyn) e 516 query con errori semantici (OurBenchSem), in cui il codice non soddisfa le intenzioni dell'utente. Le query hanno una complessità media di oltre 14 componenti. OurBench utilizza un flusso di lavoro di costruzione automatizzato che inietta bug realistici tramite reverse engineering e un framework di valutazione senza esecuzione per una valutazione rapida e accurata. Ciò affronta la sfida che anche LLM avanzati e sviluppatori esperti faticano a produrre SQL completamente corretto in un unico tentativo.
Fatti principali
- OurBench è il primo benchmark per il ragionamento e il debugging di SQL a livello aziendale
- Contiene 469 query con errori di sintassi (OurBenchSyn) e 516 query con errori semantici (OurBenchSem)
- Le query hanno una complessità media di oltre 14 componenti
- Utilizza il reverse engineering per iniettare bug realistici
- Impiega un framework di valutazione senza esecuzione
- Mira a migliorare le capacità di debugging degli LLM per SQL aziendale
- Affronta le limitazioni dei benchmark text-to-SQL a tentativo singolo
- Pubblicato su arXiv con ID 2601.18119
Entità
Istituzioni
- arXiv