I LLM Mostrano Promesse ma Falliscono nell'Analisi dei Protocolli di Sicurezza
Uno studio recente ha indagato la capacità dei Large Language Models (LLM) di condurre analisi simboliche di protocolli di sicurezza, confrontando le loro prestazioni con strumenti formali consolidati come ProVerif e OFMC. I ricercatori hanno esaminato GPT e DeepSeek sia in modalità chat che ragionamento in tre prove su 130 protocolli AnB/AnBx offuscati, affrontando 388 obiettivi di sicurezza. I modelli chat hanno mostrato un tasso di richiamo tra il 69 e l'81%, ma la loro precisione è scesa al di sotto del 31%. Al contrario, i modelli di ragionamento hanno migliorato la precisione, raggiungendo il 66,5% per GPT e il 45,4% per DeepSeek, sebbene abbiano identificato poco più della metà degli attacchi. È interessante notare che le due modalità di DeepSeek utilizzano un unico modello sottostante, migliorando la precisione dal 27,2% al 45,4%. Tutti i modelli hanno avuto maggiori difficoltà con gli obiettivi di autenticazione, con i modelli di ragionamento che hanno rilevato meno della metà degli attacchi.
Fatti principali
- Lo studio valuta i LLM per l'analisi simbolica dei protocolli di sicurezza
- Testa GPT e DeepSeek in modalità chat e ragionamento
- Tre esecuzioni su 130 protocolli AnB/AnBx offuscati
- Copre 388 obiettivi di sicurezza
- Valutati rispetto a ProVerif e OFMC
- Modelli chat: richiamo 69-81%, precisione sotto il 31%
- Modelli di ragionamento: GPT precisione 66,5%, DeepSeek precisione 45,4%
- Tutti i modelli peggiori sugli obiettivi di autenticazione
Entità
Istituzioni
- arXiv