SciRet: Studio Compute-Aware di Recupero e Ri-Ranking per RAG Scientifico
Uno studio recente intitolato SciRet valuta l'efficacia della generazione aumentata da recupero (RAG) per rispondere a domande scientifiche utilizzando il dataset CORD-19. La ricerca ha sperimentato un approccio RAG standardizzato su tre dimensioni di dataset: 1.034, 5.160 e 15.480 chunk, che rappresentano rispettivamente 1.000, 5.000 e 15.000 articoli. L'indagine ha rilevato che l'integrazione di più tecniche di recupero produce risultati migliori rispetto agli approcci a metodo singolo, raggiungendo un Recall@10 perfetto sia per il dataset più piccolo che per quello più grande. Tuttavia, l'applicazione di un ri-ranker cross-encoder addestrato con MS MARCO ha influenzato negativamente l'accuratezza in scenari scientifici. In particolare, dataset più grandi hanno contribuito a risultati di generazione più affidabili.
Fatti principali
- SciRet è uno studio empirico compute-aware sulla generazione aumentata da recupero per il question answering scientifico.
- Lo studio utilizza il corpus CORD-19.
- Vengono valutate tre scale di corpus: 1.034 chunk (1K articoli), 5.160 chunk (5K articoli) e 15.480 chunk (15K articoli).
- La pipeline include chunking a finestra di frase, BM25, recupero denso BGE-M3, fusione dei ranghi reciproci, ri-ranking opzionale con cross-encoder e generazione di risposte basata su fonti.
- Il recupero ibrido raggiunge Recall@10 di 1.000 a scale 1K e 15K.
- Un ri-ranker cross-encoder addestrato su MS MARCO riduce la precisione sul corpus scientifico.
- La fedeltà di generazione misurata con RAGAS aumenta con la scala del corpus.
- L'articolo è disponibile su arXiv con identificativo 2608.03860.
Entità
Istituzioni
- arXiv