RAG-Stack: Ottimizzare i compromessi qualità-prestazioni nella generazione aumentata da recupero
RAG-Stack è un framework di nuova introduzione progettato per migliorare l'equilibrio tra qualità delle risposte e prestazioni nei sistemi di generazione aumentata da recupero (RAG). RAG integra la generazione di modelli linguistici di grandi dimensioni (LLM) con dati recuperati da database, rendendolo popolare per attività ad alta intensità di conoscenza. Tuttavia, le varie opzioni di configurazione nei sistemi RAG contemporanei—come gli indici di recupero e le scelte dei modelli—creano diversi compromessi qualità-prestazioni, complicando la selezione della configurazione migliore per usi specifici. Il framework, descritto in un articolo arXiv (2608.03487), identifica le frontiere di Pareto qualità-prestazioni attraverso varie applicazioni RAG. Comprende tre parti: RAG-PE, RAG-IR e RAG-CM, affrontando una sfida significativa nella distribuzione dei sistemi RAG.
Fatti principali
- RAG-Stack è un framework per scoprire le frontiere di Pareto qualità-prestazioni nei sistemi RAG.
- È composto dai componenti RAG-PE, RAG-IR e RAG-CM.
- RAG-PE è un algoritmo iterativo di esplorazione dello spazio di progettazione.
- RAG-IR è un'astrazione del carico di lavoro per diversi algoritmi RAG.
- RAG-CM è un modello di prestazioni che prevede la distribuzione ottimale.
- L'articolo è disponibile su arXiv con ID 2608.03487.
- Il tipo di annuncio è 'cross', indicando una possibile sottomissione a conferenza.
- RAG aumenta la generazione LLM con informazioni recuperate da database.
Entità
Istituzioni
- arXiv