ARTFEED — Contemporary Art Intelligence

MegaSlide-DiT: Video Diffusion Efficiente in Memoria su Singola GPU

ai-technology · 2026-07-29

I ricercatori hanno presentato MegaSlide-DiT, un prototipo che adatta un Diffusion Transformer (DiT) pre-addestrato con 105 miliardi di parametri per la generazione di video ad alta risoluzione su una singola GPU NVIDIA H200 con 1,5 TB di RAM host. Il sistema affronta due principali colli di bottiglia della memoria: la memoria dei parametri e la memoria di attivazione. Mantenendo tutti i pesi persistenti, i pesi master e i momenti dell'ottimizzatore nella memoria host e trasmettendo solo shard transitori alla GPU su richiesta, MegaSlide-DiT elimina la necessità di grandi cluster di GPU. Inoltre, sostituisce l'attenzione globale quadratica con un'attenzione locale deformabile 3D per ridurre la memoria di attivazione. L'approccio è descritto in un articolo pubblicato su arXiv (2607.22696).

Fatti principali

  • MegaSlide-DiT adatta un DiT con 105 miliardi di parametri su una singola GPU H200.
  • Il sistema utilizza 1,5 TB di RAM host per lo stato persistente del modello.
  • Shard transitori vengono trasmessi alla GPU su richiesta.
  • Sostituisce l'attenzione globale quadratica con attenzione locale deformabile 3D.
  • Affronta i colli di bottiglia della memoria dei parametri e della memoria di attivazione.
  • Articolo pubblicato su arXiv con ID 2607.22696.
  • Basato su Diffusion Transformers (DiT) per video ad alta risoluzione.
  • Progettato per evitare grandi cluster di GPU per l'adattamento.

Entità

Istituzioni

  • arXiv

Fonti