Evitare la Cancellazione nella Modifica del Codice con LLM: Una Nuova Sfida per la Manutenibilità dell'IA
Un recente preprint su arXiv (2607.28887) rivela un problema significativo noto come 'evitare la cancellazione' nei grandi modelli linguistici (LLM) utilizzati per la modifica del codice. Questa ricerca valuta cinque modelli prominenti sulla classifica SWE-bench Verified, scoprendo che il richiamo delle cancellazioni per le patch degli sviluppatori raggiunge al massimo il 71,7%, anche per compiti che tutti i modelli riescono a completare. Mentre i modelli identificano il file corretto per oltre il 92% delle cancellazioni necessarie, rimuovono accuratamente la riga specifica in meno del 52% dei casi. In particolare, il 29,0% delle patch riuscite impiega una strategia chiamata 'Guard-and-Go', in cui il codice mirato viene racchiuso in una guardia o fallback. Lo studio indica che le patch generate dagli LLM potrebbero avere un impatto negativo sulla manutenibilità del codice, nonostante superino i test. Lo studio completo è disponibile all'indirizzo https://arxiv.org/abs/2607.28887.
Fatti principali
- L'evitare la cancellazione è una tendenza sistematica negli LLM a mantenere codice che una modifica intenzionale richiederebbe di rimuovere.
- Attraverso cinque modelli leader su SWE-bench Verified, il richiamo delle cancellazioni rispetto alla patch dello sviluppatore raggiunge al massimo il 71,7%.
- I modelli raggiungono il file giusto per oltre il 92% delle cancellazioni richieste, ma tagliano la riga esatta in meno del 52% dei casi.
- Il 29,0% delle patch che superano i test avvolge il codice mirato in una guardia o fallback, un modello chiamato 'Guard-and-Go'.
- L'adeguamento di 34 compiti Verified con test che falliscono se il codice mirato rimane fa scendere quattro modelli di frontiera dal 63,2% al 41,9%.
- Lo studio è pubblicato su arXiv con ID 2607.28887.
Entità
Istituzioni
- arXiv