ARTFEED — Contemporary Art Intelligence

PTStore: Caching distribuito di prefissi per un'inferenza efficiente dei LLM

ai-technology · 2026-07-29

PTStore è un sistema distribuito di caching e replica di prefissi per l'inferenza di modelli linguistici di grandi dimensioni, ispirato alle reti di distribuzione dei contenuti. Distribuisce e replica i prefissi popolari della cache KV tra i nodi per ridurre la latenza e lo squilibrio di carico. Decentralizzando la cache KV, PTStore consente dimensioni della cache di ordini di grandezza superiori, permettendo un'inferenza 5-6 volte più efficiente su dataset di domande e risposte su lunghi passaggi rispetto alle baseline che non aggregano la memoria tra nodi e GPU.

Fatti principali

  • PTStore è un sistema distribuito di caching e replica di prefissi per l'inferenza dei LLM.
  • È ispirato al caching client nelle reti di distribuzione dei contenuti (CDN).
  • PTStore distribuisce e replica i tensori popolari che formano prefissi riutilizzabili della cache KV.
  • Riduce la latenza di accesso alla cache KV e allevia lo squilibrio di carico.
  • La decentralizzazione consente di espandere la dimensione della cache KV di ordini di grandezza.
  • PTStore esegue inferenze su dataset di domande e risposte su lunghi passaggi con un'efficienza 5-6 volte superiore rispetto alle baseline attuali.
  • Le baseline non aggregano la memoria tra diversi nodi e GPU.
  • Le baseline richiedono la rigenerazione della cache KV.

Entità

Fonti