SHE: Un Nuovo Quadro per l'Evoluzione della Sicurezza degli Agenti LLM
Un nuovo articolo intitolato 'SHE: Trajectory-driven Safety Harness Evolution for LLM Agents' è stato pubblicato su arXiv con ID 2608.09885. Esamina come migliorare la sicurezza per gli agenti dei modelli linguistici di grandi dimensioni, sostenendo che la sicurezza non riguarda solo i pesi del modello, ma anche l'infrastruttura che gestisce contesto, memoria, strumenti, permessi e controllo durante l'esecuzione. Gli autori notano che i metodi di sicurezza esistenti trattano l'infrastruttura come una parte fissa, il che limita la sua capacità di adattarsi a nuovi rischi. Propongono un quadro chiamato Safety Harness Evolution (SHE) che identifica i confini sicuri dalle traiettorie di rollout e divide l'infrastruttura in quattro componenti chiave: System Prompt, Rule Bank, Safety Memory e Tool Policy, ciascuna con la propria funzione di sicurezza. L'articolo delinea anche un ciclo di evoluzione per aiutare a diagnosticare e affrontare i fallimenti, consentendo aggiornamenti specifici e miglioramento continuo dell'infrastruttura. Questa ricerca è classificata come un nuovo annuncio ed è disponibile tramite il link arXiv fornito.
Fatti principali
- Titolo dell'articolo: 'SHE: Trajectory-driven Safety Harness Evolution for LLM Agents'
- Pubblicato su arXiv con ID 2608.09885
- Propone il quadro Safety Harness Evolution (SHE)
- Scompone l'infrastruttura in System Prompt, Rule Bank, Safety Memory e Tool Policy
- Utilizza un ciclo di evoluzione guidato dall'attribuzione dalle traiettorie di rollout
- Affronta i limiti degli artefatti di distribuzione fissi nei meccanismi di sicurezza
- Si concentra sulla sicurezza degli agenti LLM oltre i pesi del modello
- Disponibile su https://arxiv.org/abs/2608.09885
Entità
Istituzioni
- arXiv