SAGE: A Safety-First Architecture for High-Impact Generative AI Lifecycle Control
A recent study published on arXiv (2607.22926) presents SAGE, an architecture designed for high-impact generative AI that prioritizes safety and separates authorization. SAGE views catastrophic misuse as a lifecycle management challenge rather than merely a prompt filtering issue. It integrates various elements, including signed release manifests, multiple detectors, robust risk envelopes, least-risk defaults, output verification, three-valued monitoring, secure audit trails, containment strategies, and rollback capabilities. Formal findings affirm safety priorities, conservative detector limits, monotone release gating, tamper-evident records, and an authorization cut. Two PRISM abstractions validate authorization separation and lifecycle invariants. A controlled study involving 84 cases for each of four GPT, four Claude, and two Gemini versions resulted in 840 calls, yielding 794 target responses, 46 provider errors, and 449 successful detections.
Key facts
- SAGE is a safety-first architecture for high-impact generative AI.
- It addresses catastrophic misuse as a lifecycle-control problem.
- The architecture includes signed release manifests and diverse detectors.
- Formal results prove safety priority and authorization separation.
- Two PRISM abstractions verify invariants.
- A study tested 84 cases across GPT, Claude, and Gemini models.
- 840 calls resulted in 794 target responses and 46 provider errors.
- 449 detections were successful.
Entities
Institutions
- arXiv
- PRISM