CAGE: Certificazione di Agenti LLM che Usano Strumenti contro Errori di Binding
Un nuovo articolo arXiv (2607.29190) introduce CAGE, un metodo di certificazione per agenti basati su grandi modelli linguistici (LLM) che utilizzano strumenti. L'articolo affronta una lacuna critica nella sicurezza: i gate di autorizzazione a runtime tipicamente autorizzano azioni basate sui ritorni osservati dagli strumenti, ma non tengono conto di piccoli errori nel modo in cui questi ritorni sono associati alle loro fonti. CAGE certifica che un'azione candidata rimane autorizzata su un intorno dichiarato di ritorni plausibilmente corretti e associati, considerando un errore di binding ammissibile e una deriva numerica limitata. Gli autori dimostrano che certificare separatamente i canali categorici e numerici non compone; perturbazioni sicure su ciascun canale da solo possono congiuntamente rendere un'azione non sicura. CAGE certifica direttamente l'intorno congiunto, enumerando esattamente i rami discreti e certificando le perturbazioni continue all'interno di ciascun ramo. Il metodo è valutato in contesti sintetici, policy-as-code, normativi e di transazioni reali, e rimuove i falsi permessi entro budget che i metodi puntuali accurati non rilevano. L'articolo è scritto da ricercatori (nomi non forniti nell'abstract) ed è disponibile su arXiv.
Fatti principali
- L'articolo arXiv:2607.29190 introduce CAGE.
- CAGE certifica agenti LLM che usano strumenti contro errori di binding.
- I gate di autorizzazione a runtime autorizzano ritorni e azioni osservati.
- CAGE considera un errore di binding ammissibile e una deriva numerica limitata.
- La certificazione separata dei canali categorici e numerici non compone.
- CAGE enumera rami discreti e certifica perturbazioni continue.
- Valutato in contesti sintetici, policy-as-code, normativi e di transazioni reali.
- CAGE rimuove i falsi permessi entro budget che i metodi puntuali non rilevano.
Entità
Istituzioni
- arXiv