Perdita di Trattamento Rilevata nella Valutazione della Sicurezza dell'Agente MCP
Una valutazione della sicurezza riguardante agenti che utilizzano strumenti ha rivelato una perdita di trattamento, dove le etichette memorizzate non rappresentano accuratamente le realtà comportamentali. Questo audit, che si è basato su una campagna conservata, ha tracciato 10.200 righe di esecuzione fino a 180 richieste legate a modelli, 45 richieste semantiche e 15 stimoli osservabili. Sebbene due trattamenti di schema siano stati implementati, il corpus di payload esterni previsto era assente. Il valutatore storico ha mostrato una chiara perdita di trattamento: i metadati del trattamento limitavano la classe ATTACK_SUCCESS, indicando che un comportamento fisso poteva alterare la classe sotto la rietichettatura del trattamento. Una ricostruzione cieca al trattamento ha corretto 58 etichette storiche ATTACK_SUCCESS o HIJACK_ATTEMPT in completamenti benigni autorizzati, mantenendo tre trasferimenti verificati di dati protetti e un incidente separato di inoltro non autorizzato. Il censimento v2 bloccato non mostra record ATTACK_SUCCESS, con l'incidente di inoltro ancora classificato come HIJACK_ATTEMPT a un confine semantico relativo al completamento dell'obiettivo. È stata condotta una revisione della concordanza in cieco con doppio revisore, sottolineando l'importanza della validità di costrutto nelle valutazioni di sicurezza degli agenti AI.
Fatti principali
- 10.200 righe di esecuzione sono state tracciate fino a 180 richieste legate a modelli, 45 richieste semantiche e 15 stimoli osservabili.
- Sono stati forniti due trattamenti di schema, ma il corpus di payload esterni pianificato non è stato fornito.
- I metadati del trattamento limitavano la classe ATTACK_SUCCESS, causando una diretta perdita di trattamento.
- 58 etichette storiche ATTACK_SUCCESS o HIJACK_ATTEMPT sono state corrette in completamenti benigni autorizzati.
- Sono stati preservati tre trasferimenti verificati di dati protetti e un caso separato di inoltro non autorizzato.
- Il censimento v2 bloccato contiene esattamente zero record ATTACK_SUCCESS.
- Il caso di inoltro rimane un HIJACK_ATTEMPT a un confine semantico riguardante il completamento dell'obiettivo.
- È stata condotta una revisione della concordanza in cieco con doppio revisore.
Entità
—