Studio Rivela che il 46% dei Test Superati negli Agenti di Riparazione LLM Mancano di Prove Discriminanti sui Bug
Uno studio recente pubblicato su arXiv, identificato come preprint 2607.28871, ha rivelato che il 46% dei test superati per gli agenti di riparazione basati su modelli linguistici di grandi dimensioni (LLM) non forniscono prove sufficienti per discriminare i bug. La ricerca ha analizzato 3.730 eventi in 643 rollout coinvolgendo 110 compiti. In particolare, il 23,8% dei rollout di base si è concluso con prove non discriminanti. Lo studio ha anche introdotto il metodo BSG-VA e condotto un esperimento a tre bracci per valutare il feedback B-replay, evidenziando significative lacune nel processo di validazione delle tecnologie AI.
Fatti principali
- Preprint arXiv 2607.28871
- Metodo BSG-VA introdotto
- 3.730 eventi analizzati
- 643 rollout su 110 compiti
- Il 46,0% degli eventi positivi comparabili manca di informazioni discriminanti sui bug
- Il 23,8% dei rollout di base si chiude con prove non discriminanti
- Esperimento a tre bracci testa il feedback B-replay
- Pubblicato su arXiv
Entità
Istituzioni
- arXiv