Vulnerabilità nella generazione di codice LLM superano il 56% in scenari realistici
Un nuovo studio di arXiv (2607.23088) rivela che i modelli linguistici di grandi dimensioni (LLM) utilizzati per la generazione di codice presentano tassi medi di vulnerabilità superiori al 56% in scenari di rischio realistici. La ricerca identifica tre scenari chiave che portano a falle di sicurezza: requisiti ambigui, contesto operativo sottospecificato e conflitto tra sicurezza e funzionalità. Il benchmark include 2.700 casi di test per una valutazione granulare. Sono stati testati otto LLM all'avanguardia, tutti con alti tassi di vulnerabilità.
Fatti principali
- Articolo arXiv 2607.23088
- Gli LLM per la generazione di codice hanno tassi medi di vulnerabilità superiori al 56%
- Tre scenari di rischio: requisiti ambigui, contesto operativo sottospecificato, conflitto sicurezza-funzionalità
- Benchmark di 2.700 casi di test
- Otto LLM all'avanguardia valutati
- I benchmark esistenti non riescono a catturare prompt ambigui del mondo reale
Entità
Istituzioni
- arXiv