ARTFEED — Contemporary Art Intelligence

I LLM Mostrano Promesse ma Falliscono nell'Analisi dei Protocolli di Sicurezza

ai-technology · 2026-07-29

Uno studio recente ha indagato la capacità dei Large Language Models (LLM) di condurre analisi simboliche di protocolli di sicurezza, confrontando le loro prestazioni con strumenti formali consolidati come ProVerif e OFMC. I ricercatori hanno esaminato GPT e DeepSeek sia in modalità chat che ragionamento in tre prove su 130 protocolli AnB/AnBx offuscati, affrontando 388 obiettivi di sicurezza. I modelli chat hanno mostrato un tasso di richiamo tra il 69 e l'81%, ma la loro precisione è scesa al di sotto del 31%. Al contrario, i modelli di ragionamento hanno migliorato la precisione, raggiungendo il 66,5% per GPT e il 45,4% per DeepSeek, sebbene abbiano identificato poco più della metà degli attacchi. È interessante notare che le due modalità di DeepSeek utilizzano un unico modello sottostante, migliorando la precisione dal 27,2% al 45,4%. Tutti i modelli hanno avuto maggiori difficoltà con gli obiettivi di autenticazione, con i modelli di ragionamento che hanno rilevato meno della metà degli attacchi.

Fatti principali

  • Lo studio valuta i LLM per l'analisi simbolica dei protocolli di sicurezza
  • Testa GPT e DeepSeek in modalità chat e ragionamento
  • Tre esecuzioni su 130 protocolli AnB/AnBx offuscati
  • Copre 388 obiettivi di sicurezza
  • Valutati rispetto a ProVerif e OFMC
  • Modelli chat: richiamo 69-81%, precisione sotto il 31%
  • Modelli di ragionamento: GPT precisione 66,5%, DeepSeek precisione 45,4%
  • Tutti i modelli peggiori sugli obiettivi di autenticazione

Entità

Istituzioni

  • arXiv

Fonti