ARTFEED — Contemporary Art Intelligence

Il collo di bottiglia MLA separa contenuto e posizione nei LLM

ai-technology · 2026-07-29

Uno studio recente sull'interpretabilità meccanicistica ha scoperto che l'attenzione latente multi-testa (MLA), presentata in DeepSeek-V2, comprime efficacemente le coppie chiave-valore utilizzando un collo di bottiglia comune a basso rango (cKV), ottenendo una riduzione dell'81% della cache KV durante l'inferenza. La ricerca ha addestrato un trasformatore con 114 milioni di parametri su un mix di dati web, codice e matematica, seguito da un fine-tuning su TinyStories. Attraverso tecniche come SVD, tassonomia delle teste di attenzione, probing lineare e disruption-attribution, è emerso che il collo di bottiglia cKV conserva una rappresentazione pura del contenuto con una ritenzione dell'identità delle entità del 98%, eliminando i dati posizionali, confermando la capacità di MLA di separare contenuto e posizione tramite RoPE. Le teste di induzione si raggruppano in un singolo strato. Questo segna la prima analisi dettagliata delle informazioni preservate o scartate dal collo di bottiglia e del suo impatto sui circuiti del trasformatore.

Fatti principali

  • MLA comprime le coppie chiave-valore attraverso un collo di bottiglia condiviso a basso rango (cKV).
  • Ottiene una riduzione dell'81% della cache KV durante l'inferenza.
  • Lo studio ha addestrato un trasformatore con 114 milioni di parametri.
  • Il modello è stato pre-addestrato su un mix di web/codice/matematica e affinato su TinyStories.
  • Il collo di bottiglia cKV preserva l'identità delle entità con una ritenzione del 98%.
  • Il collo di bottiglia cKV scarta le informazioni posizionali.
  • Le teste di induzione si co-localizzano in un singolo strato.
  • Primo studio completo di interpretabilità meccanicistica di MLA.

Entità

Istituzioni

  • DeepSeek

Fonti