ARTFEED — Contemporary Art Intelligence

LLM e SLM Falliscono la Conformità di Sicurezza nella Generazione di Terraform

ai-technology · 2026-08-06

Un recente studio arXiv (2608.02672) valuta le prestazioni di sette modelli di intelligenza artificiale nella generazione di Infrastructure-as-Code (IaC) sicuro per AWS Terraform. Questa ricerca incorpora gli scanner di sicurezza Checkov e Trivy in una pipeline CI/CD GitLab, analizzando tre LLM chiusi—Claude Opus 4, GPT-5.4 e Gemini 2.5 Pro—e quattro SLM aperti—Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B e Magicoder-S-CL-7B—in 17 scenari. Utilizzando due strategie di prompting, lo studio valuta le prestazioni a tre livelli di sicurezza utilizzando pass@5. In particolare, scopre che la validità sintattica e la conformità di sicurezza sono in gran parte indipendenti; ad esempio, WizardCoder-33B ha un tasso di validazione del 77,8% ma nessuna conformità Checkov, mentre Claude Opus 4 raggiunge tassi di superamento del 23,1% per Checkov e del 92,5% per Trivy con prompt dettagliati. I risultati sottolineano che la sola ingegneria dei prompt non può garantire la sicurezza, rendendo necessaria un'attenzione alla valutazione della sicurezza e a metodi innovativi di generazione IaC.

Fatti principali

  • Lo studio confronta sette modelli sulla generazione sicura di AWS Terraform.
  • I modelli includono Claude Opus 4, GPT-5.4, Gemini 2.5 Pro, Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B e Magicoder-S-CL-7B.
  • Gli scanner Checkov e Trivy sono integrati nella pipeline CI/CD GitLab.
  • 17 scenari e due strategie di prompt valutati a tre livelli di sicurezza.
  • La validità sintattica e la conformità di sicurezza sono ortogonali.
  • WizardCoder-33B: tasso di validazione del 77,8%, conformità Checkov dello 0%.
  • Claude Opus 4: tassi di superamento del 23,1% per Checkov e del 92,5% per Trivy con prompt di sicurezza dettagliati.
  • La sola ingegneria dei prompt è insufficiente per la sicurezza.

Entità

Istituzioni

  • arXiv
  • GitLab

Fonti