PTStore: Caching distribuito di prefissi per un'inferenza efficiente dei LLM
PTStore è un sistema distribuito di caching e replica di prefissi per l'inferenza di modelli linguistici di grandi dimensioni, ispirato alle reti di distribuzione dei contenuti. Distribuisce e replica i prefissi popolari della cache KV tra i nodi per ridurre la latenza e lo squilibrio di carico. Decentralizzando la cache KV, PTStore consente dimensioni della cache di ordini di grandezza superiori, permettendo un'inferenza 5-6 volte più efficiente su dataset di domande e risposte su lunghi passaggi rispetto alle baseline che non aggregano la memoria tra nodi e GPU.
Fatti principali
- PTStore è un sistema distribuito di caching e replica di prefissi per l'inferenza dei LLM.
- È ispirato al caching client nelle reti di distribuzione dei contenuti (CDN).
- PTStore distribuisce e replica i tensori popolari che formano prefissi riutilizzabili della cache KV.
- Riduce la latenza di accesso alla cache KV e allevia lo squilibrio di carico.
- La decentralizzazione consente di espandere la dimensione della cache KV di ordini di grandezza.
- PTStore esegue inferenze su dataset di domande e risposte su lunghi passaggi con un'efficienza 5-6 volte superiore rispetto alle baseline attuali.
- Le baseline non aggregano la memoria tra diversi nodi e GPU.
- Le baseline richiedono la rigenerazione della cache KV.
Entità
—