Fallimenti procedurali pre-evidenza nei sistemi RAG agentici
Un recente articolo su arXiv (2608.02011) esplora una particolare modalità di fallimento nei sistemi di generazione aumentata da recupero (RAG), in cui gli agenti ottengono snippet candidati ma non li esaminano prima di fornire risposte. La ricerca categorizza le risposte errate in due tipi: fallimenti di disciplina pre-evidenza e fallimenti post-lettura dell'oro, utilizzando tracce registrate di chiamate agli strumenti, evidenze recuperate, passaggi letti e output finali. L'analisi di 12.000 traiettorie accoppiate da HotpotQA, 2WikiMultiHopQA e MuSiQue rivela che questi tipi di fallimento sono per lo più distinti, con un tasso di attivazione simultanea che varia dall'11,2% al 13,1% per gli estrattori di entità regex e spaCy. Gli autori introducono Read-Gate, un semplice requisito di runtime che impone agli agenti di leggere dopo la ricerca e prima di finalizzare le risposte. Questa lettura forzata migliora l'LLM-Acc di 14,9-19,9 punti per le traiettorie che normalmente saltano la lettura e di 3,2-9,4 punti per le celle complete di ragionamento minimale. Sono inclusi ulteriori diagnostici, sebbene l'abstract sia troncato. Questo studio è significativo per il progresso di sistemi AI affidabili nel recupero di informazioni e nel question answering.
Fatti principali
- Articolo arXiv 2608.02011
- I sistemi RAG agentici possono fallire prima che il ragionamento condizionato dall'evidenza venga testato
- Modalità di fallimento: l'agente recupera snippet ma finalizza senza ispezionarli
- Scompone le risposte errate in fallimenti di disciplina pre-evidenza e fallimenti post-lettura dell'oro
- Utilizza tracce salvate di chiamate agli strumenti, evidenze recuperate, passaggi letti e risposte finali
- 12.000 traiettorie accoppiate su HotpotQA, 2WikiMultiHopQA e MuSiQue
- Tasso di attivazione simultanea: dall'11,2% al 13,1% tra estrattori di entità regex e spaCy
- Read-Gate: invariante di runtime minimale che richiede la lettura dopo la ricerca e prima della finalizzazione
- La lettura forzata migliora l'LLM-Acc di 14,9-19,9 punti sulle traiettorie con lettura saltata
- Migliora di 3,2-9,4 punti sulle celle complete di ragionamento minimale
Entità
Istituzioni
- arXiv