SAGE: Un'architettura incentrata sulla sicurezza per il controllo del ciclo di vita dell'IA generativa ad alto impatto
Uno studio recente pubblicato su arXiv (2607.22926) presenta SAGE, un'architettura progettata per l'IA generativa ad alto impatto che dà priorità alla sicurezza e separa l'autorizzazione. SAGE considera l'uso improprio catastrofico come una sfida di gestione del ciclo di vita, piuttosto che semplicemente un problema di filtraggio dei prompt. Integra vari elementi, tra cui manifesti di rilascio firmati, molteplici rilevatori, robusti inviluppi di rischio, impostazioni predefinite a rischio minimo, verifica dell'output, monitoraggio a tre valori, registri di controllo sicuri, strategie di contenimento e capacità di rollback. I risultati formali confermano le priorità di sicurezza, i limiti conservativi dei rilevatori, il gating di rilascio monotono, i record a prova di manomissione e un taglio di autorizzazione. Due astrazioni PRISM convalidano la separazione dell'autorizzazione e gli invarianti del ciclo di vita. Uno studio controllato che ha coinvolto 84 casi per ciascuna delle quattro versioni di GPT, quattro di Claude e due di Gemini ha prodotto 840 chiamate, ottenendo 794 risposte target, 46 errori del provider e 449 rilevazioni riuscite.
Fatti principali
- SAGE è un'architettura incentrata sulla sicurezza per l'IA generativa ad alto impatto.
- Affronta l'uso improprio catastrofico come un problema di controllo del ciclo di vita.
- L'architettura include manifesti di rilascio firmati e diversi rilevatori.
- I risultati formali dimostrano la priorità della sicurezza e la separazione dell'autorizzazione.
- Due astrazioni PRISM verificano gli invarianti.
- Uno studio ha testato 84 casi su modelli GPT, Claude e Gemini.
- 840 chiamate hanno prodotto 794 risposte target e 46 errori del provider.
- 449 rilevazioni sono state riuscite.
Entità
Istituzioni
- arXiv
- PRISM