Il collo di bottiglia MLA separa contenuto e posizione nei LLM
Uno studio recente sull'interpretabilità meccanicistica ha scoperto che l'attenzione latente multi-testa (MLA), presentata in DeepSeek-V2, comprime efficacemente le coppie chiave-valore utilizzando un collo di bottiglia comune a basso rango (cKV), ottenendo una riduzione dell'81% della cache KV durante l'inferenza. La ricerca ha addestrato un trasformatore con 114 milioni di parametri su un mix di dati web, codice e matematica, seguito da un fine-tuning su TinyStories. Attraverso tecniche come SVD, tassonomia delle teste di attenzione, probing lineare e disruption-attribution, è emerso che il collo di bottiglia cKV conserva una rappresentazione pura del contenuto con una ritenzione dell'identità delle entità del 98%, eliminando i dati posizionali, confermando la capacità di MLA di separare contenuto e posizione tramite RoPE. Le teste di induzione si raggruppano in un singolo strato. Questo segna la prima analisi dettagliata delle informazioni preservate o scartate dal collo di bottiglia e del suo impatto sui circuiti del trasformatore.
Fatti principali
- MLA comprime le coppie chiave-valore attraverso un collo di bottiglia condiviso a basso rango (cKV).
- Ottiene una riduzione dell'81% della cache KV durante l'inferenza.
- Lo studio ha addestrato un trasformatore con 114 milioni di parametri.
- Il modello è stato pre-addestrato su un mix di web/codice/matematica e affinato su TinyStories.
- Il collo di bottiglia cKV preserva l'identità delle entità con una ritenzione del 98%.
- Il collo di bottiglia cKV scarta le informazioni posizionali.
- Le teste di induzione si co-localizzano in un singolo strato.
- Primo studio completo di interpretabilità meccanicistica di MLA.
Entità
Istituzioni
- DeepSeek