AgentAntibody: Sistema Immunitario Adattativo per Agenti LLM contro l'Iniezione di Prompt
Un nuovo articolo di ricerca su arXiv (2608.04053) introduce AgentAntibody, un meccanismo di difesa per agenti basati su grandi modelli linguistici (LLM) contro attacchi di iniezione di prompt. Il sistema è ispirato all'immunità adattativa, dotando gli agenti di un sistema immunitario auto-evolvente che impara da ogni incontro. Mantiene una libreria persistente di anticorpi che rappresentano il confine di sicurezza dell'utente, che riconosce le minacce e monta risposte immunitarie. L'approccio affronta il problema delle richieste utente sottospecificate, dove le iniezioni possono sfruttare l'ambiguità. L'articolo è un annuncio incrociato, indicando che è stato sottoposto a più sedi. Il lavoro è rilevante per il crescente campo della sicurezza dell'IA, in particolare per gli agenti autonomi.
Fatti principali
- Articolo: arXiv:2608.04053
- Titolo: AgentAntibody: Un sistema immunitario adattativo per difendere gli agenti LLM dall'iniezione di prompt
- Propone un sistema immunitario auto-evolvente per agenti LLM
- Ispirato all'immunità adattativa
- Usa una libreria persistente di anticorpi per rappresentare il confine di sicurezza dell'utente
- Affronta le richieste utente sottospecificate negli attacchi di iniezione di prompt
- Pubblicato su arXiv
- Tipo di annuncio: cross
Entità
Istituzioni
- arXiv