ARTFEED — Contemporary Art Intelligence

TileMix introduce un kernel di routing di precisione incentrato sui tile per l'accelerazione dell'inferenza dei LLM

ai-technology · 2026-08-19

Un recente articolo su arXiv (identificatore 2608.17336) presenta TileMix, un kernel di routing di precisione progettato per migliorare l'inferenza dei grandi modelli linguistici (LLM). Questo approccio innovativo affronta le sfide del calcolo e del traffico di memoria durante il prefill di contesti lunghi, dove l'attenzione densa calcola punteggi query-key quadratici. A differenza dei metodi tradizionali, TileMix impiega un routing di precisione spaziale su tile di punteggi allineati all'hardware. Divide la matrice di attenzione in tile di punteggi, codifica le decisioni di routing come bitmask e utilizza FP16 o INT8 per i calcoli dei punteggi, mantenendo uno stato online-softmax condiviso. Il raggruppamento di precisione scalabile consente a ogni bit di routing di influenzare più tile di chiavi adiacenti, con l'obiettivo di ridurre i costi quadratici associati all'elaborazione di contesti lunghi e aumentare la velocità di prefill e la larghezza di banda della memoria nell'inferenza dei LLM.

Fatti principali

  • TileMix è un kernel di routing di precisione incentrato sui tile per l'accelerazione dell'inferenza dei LLM.
  • L'articolo è disponibile su arXiv con identificatore 2608.17336 e tipo di annuncio 'Nuovo'.
  • Il prefill di contesti lunghi nei LLM comporta un sostanziale carico computazionale e traffico di memoria a causa dei punteggi query-key quadratici.
  • I metodi esistenti utilizzano percorsi a bassa precisione uniformi o selezionano interazioni tra token, lasciando il routing di precisione spaziale al di fuori dell'attenzione densa fusa.
  • TileMix rende la precisione numerica una decisione spaziale eseguibile su gruppi di tile di punteggi.
  • Il kernel partiziona la matrice di attenzione in tile di punteggi allineati all'hardware e compatta le decisioni di routing in bitmask compatte.
  • I gruppi di tile vengono elaborati tramite calcolo dei punteggi FP16 o INT8, con entrambi i percorsi che aggiornano uno stato online-softmax condiviso.
  • Il raggruppamento di precisione scalabile consente a ogni bit di routing di governare più tile di chiavi adiacenti, preservando tile di calcolo allineati all'hardware e metadati compatti in contesti lunghi.

Entità

Istituzioni

  • arXiv

Fonti