RAG vs GraphRAG per QA a livello di pagina su un libro di testo di matematica
Un progetto di ricerca ha valutato il Retrieval-Augmented Generation (RAG) insieme a GraphRAG per rispondere a domande a livello di pagina in un libro di testo universitario di matematica. Lo studio ha utilizzato 477 coppie domanda-risposta collegate a pagine specifiche, esaminando cinque modelli RAG basati su embedding, un baseline BM25 e GraphRAG per la loro precisione di recupero e qualità delle risposte. I risultati hanno indicato che il RAG basato su embedding ha superato GraphRAG, con voyage-3-large che ha raggiunto un'impressionante accuratezza del 99,4% nei primi 10 risultati. Il baseline BM25 ha dimostrato prestazioni robuste, superando diversi modelli di embedding. Un'analisi degli errori ha rivelato che il 63,3% degli errori al primo posto riguardava il recupero di contenuti dallo stesso capitolo, evidenziandone il significato educativo.
Fatti principali
- 477 coppie domanda-risposta da un libro di testo universitario di matematica
- Confronto tra cinque modelli RAG basati su embedding, baseline BM25 e GraphRAG
- voyage-3-large ha raggiunto il 99,4% di accuratezza di recupero nei primi 10 risultati
- BM25 ha superato diversi modelli di embedding
- Il 63,3% degli errori al primo posto ha recuperato contenuti dallo stesso capitolo
- Lo studio indaga l'uso di LLM come ausili didattici allineati ai materiali del corso
- Metriche: accuratezza di recupero e qualità delle risposte (punteggio F1)
- GraphRAG ha ottenuto prestazioni inferiori rispetto al RAG basato su embedding per il recupero a livello di pagina
Entità
Istituzioni
- arXiv