ARTFEED — Contemporary Art Intelligence

Vulnerabilità nella generazione di codice LLM superano il 56% in scenari realistici

ai-technology · 2026-07-29

Un nuovo studio di arXiv (2607.23088) rivela che i modelli linguistici di grandi dimensioni (LLM) utilizzati per la generazione di codice presentano tassi medi di vulnerabilità superiori al 56% in scenari di rischio realistici. La ricerca identifica tre scenari chiave che portano a falle di sicurezza: requisiti ambigui, contesto operativo sottospecificato e conflitto tra sicurezza e funzionalità. Il benchmark include 2.700 casi di test per una valutazione granulare. Sono stati testati otto LLM all'avanguardia, tutti con alti tassi di vulnerabilità.

Fatti principali

  • Articolo arXiv 2607.23088
  • Gli LLM per la generazione di codice hanno tassi medi di vulnerabilità superiori al 56%
  • Tre scenari di rischio: requisiti ambigui, contesto operativo sottospecificato, conflitto sicurezza-funzionalità
  • Benchmark di 2.700 casi di test
  • Otto LLM all'avanguardia valutati
  • I benchmark esistenti non riescono a catturare prompt ambigui del mondo reale

Entità

Istituzioni

  • arXiv

Fonti