Suite di Test Generate da LLM: Copertura e Punteggi di Mutazione Potrebbero Non Predire il Rilevamento di Bug
Un nuovo studio di replicabilità mette in discussione la validità dell'uso della copertura del codice e dei punteggi di mutazione come metriche proxy per valutare le suite di test generate da LLM. La ricerca, condotta da un team di autori (non specificato nell'abstract), replica lavori precedenti di Inozemtseva et al. e Papadakis et al., i quali hanno scoperto che per i test scritti da umani, le correlazioni tra copertura, mutazione e rilevamento di bug reali scompaiono in gran parte quando si controlla la dimensione della suite di test. Lo studio utilizza un'ampia gamma di suite di test generate da diversi LLM per riesaminare queste relazioni. I risultati sollevano preoccupazioni sull'affidabilità delle valutazioni basate su metriche proxy per i test generati da LLM, dato che i flussi di lavoro di generazione di test basati su LLM differiscono sostanzialmente dagli approcci tradizionali. L'articolo è disponibile su arXiv con ID 2607.22880.
Fatti principali
- Lo studio replica Inozemtseva et al. e Papadakis et al. sui test generati da LLM
- Esamina le correlazioni tra copertura, mutazione e rilevamento di bug reali
- Utilizza diversi LLM e un'ampia gamma di suite di test
- Solleva preoccupazioni sulla validità delle metriche proxy per i test generati da LLM
- Articolo disponibile su arXiv:2607.22880
Entità
Istituzioni
- arXiv