ARTFEED — Contemporary Art Intelligence

SafeKeep: Nuova Salvaguardia Riduce i Rischi di Sicurezza negli Agenti AI

ai-technology · 2026-08-03

Un recente articolo pubblicato su arXiv (2607.29254) evidenzia le specifiche degli strumenti in formato schema come un contributo significativo ai problemi di sicurezza negli agenti AI. La ricerca utilizza l'analisi della rappresentazione white-box per dimostrare che queste specifiche diminuiscono i segnali interni di rifiuto del modello, portando a un'esecuzione pericolosa degli strumenti. Per contrastare questo problema, gli autori introducono SafeKeep, una salvaguardia implementata durante l'inferenza che separa le valutazioni di sicurezza dall'esecuzione degli strumenti, valutando le richieste con specifiche testuali appiattite, mentre utilizza ancora le specifiche originali in formato schema per il processo di esecuzione. SafeKeep migliora la sicurezza senza sacrificare le prestazioni su due benchmark chiave e quattro LLM, che includono sia modelli white-box che black-box. Lo studio è scritto da un team di ricercatori ed è stato annunciato come una nuova sottomissione su arXiv.

Fatti principali

  • L'articolo è intitolato 'Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents'.
  • È disponibile su arXiv con ID 2607.29254.
  • La ricerca identifica le specifiche degli strumenti in formato schema come una fonte primaria del degrado della sicurezza degli agenti.
  • L'analisi della rappresentazione white-box rivela che queste specifiche indeboliscono i segnali interni di rifiuto.
  • SafeKeep è proposto come una salvaguardia a livello di inferenza.
  • SafeKeep disaccoppia il giudizio di sicurezza dall'esecuzione degli strumenti.
  • Utilizza specifiche testuali appiattite per la valutazione della sicurezza.
  • Il metodo è stato testato su due benchmark e quattro LLM, inclusi modelli white-box e black-box.
  • SafeKeep aumenta la sicurezza senza compromettere le prestazioni.

Entità

Istituzioni

  • arXiv

Fonti