ARTFEED — Contemporary Art Intelligence

Perdita di Trattamento Rilevata nella Valutazione della Sicurezza dell'Agente MCP

ai-technology · 2026-08-15

Una valutazione della sicurezza riguardante agenti che utilizzano strumenti ha rivelato una perdita di trattamento, dove le etichette memorizzate non rappresentano accuratamente le realtà comportamentali. Questo audit, che si è basato su una campagna conservata, ha tracciato 10.200 righe di esecuzione fino a 180 richieste legate a modelli, 45 richieste semantiche e 15 stimoli osservabili. Sebbene due trattamenti di schema siano stati implementati, il corpus di payload esterni previsto era assente. Il valutatore storico ha mostrato una chiara perdita di trattamento: i metadati del trattamento limitavano la classe ATTACK_SUCCESS, indicando che un comportamento fisso poteva alterare la classe sotto la rietichettatura del trattamento. Una ricostruzione cieca al trattamento ha corretto 58 etichette storiche ATTACK_SUCCESS o HIJACK_ATTEMPT in completamenti benigni autorizzati, mantenendo tre trasferimenti verificati di dati protetti e un incidente separato di inoltro non autorizzato. Il censimento v2 bloccato non mostra record ATTACK_SUCCESS, con l'incidente di inoltro ancora classificato come HIJACK_ATTEMPT a un confine semantico relativo al completamento dell'obiettivo. È stata condotta una revisione della concordanza in cieco con doppio revisore, sottolineando l'importanza della validità di costrutto nelle valutazioni di sicurezza degli agenti AI.

Fatti principali

  • 10.200 righe di esecuzione sono state tracciate fino a 180 richieste legate a modelli, 45 richieste semantiche e 15 stimoli osservabili.
  • Sono stati forniti due trattamenti di schema, ma il corpus di payload esterni pianificato non è stato fornito.
  • I metadati del trattamento limitavano la classe ATTACK_SUCCESS, causando una diretta perdita di trattamento.
  • 58 etichette storiche ATTACK_SUCCESS o HIJACK_ATTEMPT sono state corrette in completamenti benigni autorizzati.
  • Sono stati preservati tre trasferimenti verificati di dati protetti e un caso separato di inoltro non autorizzato.
  • Il censimento v2 bloccato contiene esattamente zero record ATTACK_SUCCESS.
  • Il caso di inoltro rimane un HIJACK_ATTEMPT a un confine semantico riguardante il completamento dell'obiettivo.
  • È stata condotta una revisione della concordanza in cieco con doppio revisore.

Entità

Fonti