Framework Open-Source Valuta le Regole di Rilevamento Cybersecurity Generate da LLM
È stato lanciato un innovativo framework open-source per la valutazione e le metriche di benchmark, progettato per misurare le prestazioni dei Large Language Models (LLM) nella creazione di regole di rilevamento per la cybersecurity. Questo framework, descritto in un articolo su arXiv (ID 2509.16749), utilizza un approccio basato su un set di holdout per confrontare le regole generate da LLM con quelle create da esseri umani. Introduce tre metriche essenziali influenzate da tecniche di valutazione esperta, fornendo una valutazione completa dei generatori di regole di sicurezza basati su LLM. La metodologia include esempi dal team di rilevamento di Sublime Security e dal suo Automated Detection Engineer (ADE), con una valutazione approfondita delle capacità di ADE inclusa nei risultati. Questa iniziativa risponde all'uso crescente degli LLM nella sicurezza, dove misure di efficacia inadeguate limitano la fiducia tra i professionisti. Il framework mira a rafforzare la fiducia negli strumenti di sicurezza basati sull'IA attraverso processi di valutazione standardizzati. L'articolo rientra nella categoria Computer Science > Crittografia e Sicurezza e contiene cronologia delle sottomissioni, riferimenti e strumenti di citazione, sottolineando la necessità di una valutazione approfondita nell'integrazione dell'IA in funzioni di sicurezza vitali.
Fatti principali
- Framework open-source di valutazione e metriche di benchmark per regole di cybersecurity generate da LLM
- Metodologia basata su set di holdout per misurare l'efficacia
- Confronto con un corpus di regole generato da esseri umani
- Tre metriche chiave ispirate alla valutazione esperta
- Illustrato utilizzando regole del team di rilevamento di Sublime Security
- Analisi dell'Automated Detection Engineer (ADE) di Sublime Security
- Articolo disponibile su arXiv con ID 2509.16749
- Categorizzato sotto Computer Science > Crittografia e Sicurezza
Entità
Istituzioni
- Sublime Security
- arXiv