ARTFEED — Contemporary Art Intelligence

DenialRAG: Nuovo attacco di avvelenamento a documento singolo sui sistemi RAG

ai-technology · 2026-08-06

Un nuovo attacco di avvelenamento a documento singolo chiamato DenialRAG è stato sviluppato dai ricercatori, specificamente mirato ai sistemi di generazione aumentata da recupero (RAG). A differenza dei metodi precedenti che si astengono dal menzionare direttamente la risposta corretta, DenialRAG incorpora la risposta corretta in un documento contaminato, la confuta esplicitamente e offre una spiegazione controllata dall'attaccante che supporta una risposta errata. Includendo sia la risposta corretta che quella contaminata nello stesso passaggio recuperato, l'attacco crea un conflitto diretto nel contesto del generatore. Questo metodo è stato testato contro quattro attacchi di avvelenamento a documento singolo esistenti su tre dataset di question answering open-domain e otto modelli linguistici di grandi dimensioni (LLM) target. I risultati sono documentati su arXiv con l'identificatore 2608.02678, sottolineando la necessità di difese più forti contro l'avvelenamento del corpus nella sicurezza RAG.

Fatti principali

  • DenialRAG è un attacco di avvelenamento a documento singolo che nomina e nega esplicitamente la risposta corretta.
  • L'attacco incorpora il conflitto tra risposte corrette e avvelenate nello stesso passaggio recuperato.
  • Valutato contro quattro attacchi di avvelenamento a documento singolo pubblicati.
  • Testato su tre dataset di question answering open-domain.
  • Testato su otto modelli linguistici di grandi dimensioni (LLM) target.
  • Articolo disponibile su arXiv con identificatore 2608.02678.
  • L'attacco mira ai sistemi di generazione aumentata da recupero (RAG).
  • Gli attacchi precedenti tipicamente evitano di nominare esplicitamente la risposta corretta.

Entità

Istituzioni

  • arXiv

Fonti