ARTFEED — Contemporary Art Intelligence

X-Stage: Una Nuova Fase di Pipeline per la Sovrapposizione Comunicazione-Calcolo nell'Inferenza DiT

other · 2026-07-29

I ricercatori hanno scoperto una fase precedentemente inosservata nella pipeline chiamata X-Stage, che fa parte dell'inferenza distribuita del trasformatore di diffusione (DiT). Questa fase visibile al software si verifica dopo l'avvio della comunicazione ma prima che il completamento sia visibile a distanza. Test condotti su un nodo a otto GPU utilizzando una recente architettura NVIDIA dimostrano che brevi raffiche di remote-store esauriscono le risorse mentre l'emittente continua i suoi compiti, mentre un'iniezione prolungata utilizza la limitata capacità in sospeso, causando ritardi nelle emissioni successive. Un modello leggero Burst-Gap, definito dal tempo di emissione senza backpressure, dal tasso di drenaggio effettivo e dalla capacità in sospeso, prevede il sovraccarico di emissione, i tempi di recupero tra le raffiche e l'insorgenza del backpressure. Questo modello informa la riprogettazione di due metodi di comunicazione per migliorare la sovrapposizione e ridurre la latenza di inferenza. Lo studio colma una lacuna nei sistemi attuali che gestiscono quando la comunicazione viene inviata e quando i dati ricevuti possono essere utilizzati, trascurando il progresso dopo l'emissione, il che complica la previsione del backpressure del mittente. I risultati sono pubblicati in un articolo su arXiv (2607.23264).

Fatti principali

  • X-Stage è una fase di pipeline post-emissione visibile al software per la sovrapposizione comunicazione-calcolo.
  • Le misurazioni sono state condotte su un nodo a otto GPU con una recente architettura NVIDIA.
  • Brevi raffiche di remote-store si esauriscono mentre l'emittente riprende il lavoro.
  • L'iniezione sostenuta esaurisce la capacità finita in sospeso e ritarda le emissioni successive.
  • Un modello Burst-Gap prevede il sovraccarico di emissione, il recupero tra le raffiche e l'insorgenza del backpressure.
  • Il modello è parametrizzato dal tempo di emissione senza backpressure, dal tasso di drenaggio effettivo e dalla capacità in sospeso.
  • Il lavoro riprogetta due schemi di comunicazione guidati dal modello.
  • L'articolo è disponibile su arXiv con ID 2607.23264.

Entità

Istituzioni

  • arXiv
  • NVIDIA

Fonti