REDAgentBench: Red Teaming Eseguibile e Misurazione Fedele dei Sistemi Agente LLM
Un recente articolo su arXiv (2608.10669) ha presentato un nuovo standard per valutare la sicurezza degli agenti basati su modelli linguistici di grandi dimensioni (LLM). Denominato REDAgentBench, questo framework eseguibile facilita il red teaming autonomo e la valutazione accurata dei sistemi agente. Genera attacchi basati su vincoli di sicurezza definiti e vulnerabilità, eseguendoli in sandbox di servizio isolate, confermando gli esiti dannosi tramite ricevute di servizio e cambiamenti negli stati finali. Il benchmark comprende 1.661 scenari su cinque superfici di servizio. L'analisi di sei modelli e tre harness agente rivela un tasso di successo degli attacchi (ASR) medio macro del 65,69%. Gli autori sostengono che le valutazioni attuali spesso semplificano la sicurezza degli agenti a un singolo ASR, fondendo esposizione, esecuzione, osservazione e aggiudicazione, il che può oscurare violazioni reali. REDAgentBench mira a migliorare la fedeltà della misurazione distinguendo questi elementi.
Fatti principali
- REDAgentBench è un framework eseguibile per il red teaming autonomo e la misurazione fedele dei sistemi agente LLM.
- Deriva attacchi da vincoli di sicurezza espliciti e vulnerabilità associate del sistema agente.
- Gli attacchi vengono eseguiti in sandbox di servizio isolate.
- Gli effetti dannosi sono verificati tramite ricevute di servizio e cambiamenti nello stato finale.
- Il benchmark contiene 1.661 casi su cinque superfici di servizio.
- Attraverso sei modelli e tre harness agente, l'ASR medio macro è del 65,69%.
- L'articolo critica le valutazioni esistenti per ridurre la sicurezza degli agenti a un singolo ASR.
- REDAgentBench mira a separare esposizione, esecuzione, osservazione e aggiudicazione per una misurazione fedele.
Entità
Istituzioni
- arXiv