ARTFEED — Contemporary Art Intelligence

Fusione dell'Attenzione Disaccoppiata: Accelerare il RAG con un Efficiente Riutilizzo della Cache KV

other · 2026-07-27

Un nuovo approccio chiamato Fusione dell'Attenzione Disaccoppiata (DAF) è stato introdotto per ridurre al minimo la latenza nella Generazione Aumentata da Recupero (RAG) per modelli linguistici estesi. In situazioni di contesto lungo, il RAG subisce ritardi significativi nel Time-To-First-Token (TTFT). Il riutilizzo delle cache KV dei documenti precalcolate porta a una mancata corrispondenza nella distribuzione, poiché le cache offline non catturano i pattern di attenzione inter-documento. Mentre CacheBlend riduce il ricalcolo attraverso l'attenzione selettiva, compromette l'accuratezza in contesti più lunghi. Il DAF affronta questo problema separando l'attenzione in tre fasi: auto-attenzione per i token importanti, auto-attenzione per le interazioni domanda-documento e fusione degli stati, mantenendo con successo un'elevata accuratezza riducendo al contempo i costi di ricalcolo.

Fatti principali

  • La Generazione Aumentata da Recupero (RAG) mitiga le allucinazioni nei LLM
  • Il RAG soffre di una latenza proibitiva del Time-To-First-Token (TTFT) in scenari di contesto lungo
  • Il riutilizzo delle cache KV dei documenti precalcolate introduce una mancata corrispondenza nella distribuzione
  • Le cache offline mancano dei pattern di attenzione inter-documento necessari per un ragionamento coerente
  • CacheBlend riduce il ricalcolo tramite attenzione selettiva
  • CacheBlend subisce un grave degrado dell'accuratezza in contesti più lunghi
  • La Fusione dell'Attenzione Disaccoppiata (DAF) mantiene un'elevata accuratezza riducendo il sovraccarico del ricalcolo
  • Il DAF disaccoppia l'attenzione in tre fasi integrate

Entità

Fonti