Leggi di scala per la sicurezza dell'IA: bilanciare carattere e regole
Un nuovo articolo su arXiv (2608.13345) introduce un modello formale per ottimizzare la progettazione della sicurezza dell'IA man mano che la distribuzione scala. Gli autori propongono un parametro di allocazione delle risorse alpha tra la modellazione del carattere (ad esempio, RLHF, IA costituzionale) e l'applicazione delle regole (ad esempio, filtri di output), incorporando il degrado dei filtri dipendente dalla scala, guasti in modalità comune e fragilità del carattere. Utilizzando un modello di danno moltiplicativo di Pareto, derivano il danno atteso in forma chiusa e lo integrano con un'analisi del rischio di coda (CVaR) tramite simulazione Monte Carlo in tre scenari. L'articolo affronta una lacuna nell'analisi formale di come l'equilibrio ottimale tra misure di sicurezza in fase di addestramento e di inferenza dovrebbe cambiare con la scala.
Fatti principali
- Articolo arXiv:2608.13345v1, annunciato come nuovo
- Introduce un modello stilizzato di statica comparata per la progettazione della sicurezza dell'IA
- Parametrizza la progettazione della sicurezza come allocazione delle risorse alpha in [0,1] tra modellazione del carattere e applicazione delle regole
- Incorpora il degrado dei filtri dipendente dalla scala, guasti in modalità comune e fragilità del carattere
- Utilizza un modello di danno moltiplicativo di Pareto per derivare il danno atteso in forma chiusa
- Integrato con un'analisi del rischio di coda (CVaR) tramite simulazione Monte Carlo
- Analizza tre scenari: ottimista, mod... (incompleto nella fonte)
- Pubblicato su arXiv, URL: https://arxiv.org/abs/2608.13345
Entità
Istituzioni
- arXiv