ARTFEED — Contemporary Art Intelligence

SHE: Un Nuovo Quadro per l'Evoluzione della Sicurezza degli Agenti LLM

ai-technology · 2026-08-11

Un nuovo articolo intitolato 'SHE: Trajectory-driven Safety Harness Evolution for LLM Agents' è stato pubblicato su arXiv con ID 2608.09885. Esamina come migliorare la sicurezza per gli agenti dei modelli linguistici di grandi dimensioni, sostenendo che la sicurezza non riguarda solo i pesi del modello, ma anche l'infrastruttura che gestisce contesto, memoria, strumenti, permessi e controllo durante l'esecuzione. Gli autori notano che i metodi di sicurezza esistenti trattano l'infrastruttura come una parte fissa, il che limita la sua capacità di adattarsi a nuovi rischi. Propongono un quadro chiamato Safety Harness Evolution (SHE) che identifica i confini sicuri dalle traiettorie di rollout e divide l'infrastruttura in quattro componenti chiave: System Prompt, Rule Bank, Safety Memory e Tool Policy, ciascuna con la propria funzione di sicurezza. L'articolo delinea anche un ciclo di evoluzione per aiutare a diagnosticare e affrontare i fallimenti, consentendo aggiornamenti specifici e miglioramento continuo dell'infrastruttura. Questa ricerca è classificata come un nuovo annuncio ed è disponibile tramite il link arXiv fornito.

Fatti principali

  • Titolo dell'articolo: 'SHE: Trajectory-driven Safety Harness Evolution for LLM Agents'
  • Pubblicato su arXiv con ID 2608.09885
  • Propone il quadro Safety Harness Evolution (SHE)
  • Scompone l'infrastruttura in System Prompt, Rule Bank, Safety Memory e Tool Policy
  • Utilizza un ciclo di evoluzione guidato dall'attribuzione dalle traiettorie di rollout
  • Affronta i limiti degli artefatti di distribuzione fissi nei meccanismi di sicurezza
  • Si concentra sulla sicurezza degli agenti LLM oltre i pesi del modello
  • Disponibile su https://arxiv.org/abs/2608.09885

Entità

Istituzioni

  • arXiv

Fonti