Fusione dell'Attenzione Disaccoppiata: Accelerare il RAG con un Efficiente Riutilizzo della Cache KV
Un nuovo approccio chiamato Fusione dell'Attenzione Disaccoppiata (DAF) è stato introdotto per ridurre al minimo la latenza nella Generazione Aumentata da Recupero (RAG) per modelli linguistici estesi. In situazioni di contesto lungo, il RAG subisce ritardi significativi nel Time-To-First-Token (TTFT). Il riutilizzo delle cache KV dei documenti precalcolate porta a una mancata corrispondenza nella distribuzione, poiché le cache offline non catturano i pattern di attenzione inter-documento. Mentre CacheBlend riduce il ricalcolo attraverso l'attenzione selettiva, compromette l'accuratezza in contesti più lunghi. Il DAF affronta questo problema separando l'attenzione in tre fasi: auto-attenzione per i token importanti, auto-attenzione per le interazioni domanda-documento e fusione degli stati, mantenendo con successo un'elevata accuratezza riducendo al contempo i costi di ricalcolo.
Fatti principali
- La Generazione Aumentata da Recupero (RAG) mitiga le allucinazioni nei LLM
- Il RAG soffre di una latenza proibitiva del Time-To-First-Token (TTFT) in scenari di contesto lungo
- Il riutilizzo delle cache KV dei documenti precalcolate introduce una mancata corrispondenza nella distribuzione
- Le cache offline mancano dei pattern di attenzione inter-documento necessari per un ragionamento coerente
- CacheBlend riduce il ricalcolo tramite attenzione selettiva
- CacheBlend subisce un grave degrado dell'accuratezza in contesti più lunghi
- La Fusione dell'Attenzione Disaccoppiata (DAF) mantiene un'elevata accuratezza riducendo il sovraccarico del ricalcolo
- Il DAF disaccoppia l'attenzione in tre fasi integrate
Entità
—