LLM e SLM Falliscono la Conformità di Sicurezza nella Generazione di Terraform
Un recente studio arXiv (2608.02672) valuta le prestazioni di sette modelli di intelligenza artificiale nella generazione di Infrastructure-as-Code (IaC) sicuro per AWS Terraform. Questa ricerca incorpora gli scanner di sicurezza Checkov e Trivy in una pipeline CI/CD GitLab, analizzando tre LLM chiusi—Claude Opus 4, GPT-5.4 e Gemini 2.5 Pro—e quattro SLM aperti—Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B e Magicoder-S-CL-7B—in 17 scenari. Utilizzando due strategie di prompting, lo studio valuta le prestazioni a tre livelli di sicurezza utilizzando pass@5. In particolare, scopre che la validità sintattica e la conformità di sicurezza sono in gran parte indipendenti; ad esempio, WizardCoder-33B ha un tasso di validazione del 77,8% ma nessuna conformità Checkov, mentre Claude Opus 4 raggiunge tassi di superamento del 23,1% per Checkov e del 92,5% per Trivy con prompt dettagliati. I risultati sottolineano che la sola ingegneria dei prompt non può garantire la sicurezza, rendendo necessaria un'attenzione alla valutazione della sicurezza e a metodi innovativi di generazione IaC.
Fatti principali
- Lo studio confronta sette modelli sulla generazione sicura di AWS Terraform.
- I modelli includono Claude Opus 4, GPT-5.4, Gemini 2.5 Pro, Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B e Magicoder-S-CL-7B.
- Gli scanner Checkov e Trivy sono integrati nella pipeline CI/CD GitLab.
- 17 scenari e due strategie di prompt valutati a tre livelli di sicurezza.
- La validità sintattica e la conformità di sicurezza sono ortogonali.
- WizardCoder-33B: tasso di validazione del 77,8%, conformità Checkov dello 0%.
- Claude Opus 4: tassi di superamento del 23,1% per Checkov e del 92,5% per Trivy con prompt di sicurezza dettagliati.
- La sola ingegneria dei prompt è insufficiente per la sicurezza.
Entità
Istituzioni
- arXiv
- GitLab