Generazione di video fluidi basata sulla fisica con dataset di simulazione e supervisione a doppio flusso
Uno studio recente disponibile su arXiv presenta una nuova tecnica per migliorare la generazione di video fluidi all'interno di modelli di diffusione integrando una supervisione basata sulla fisica. I ricercatori notano che i modelli di diffusione video esistenti, sebbene visivamente impressionanti, spesso rappresentano comportamenti fluidi non realistici, come colonne di liquido che si rompono a mezz'aria o livelli dell'acqua che non salgono durante il versamento. Per affrontare questo problema, hanno sviluppato un dataset di fluidi che include 1.638 video di versamento e sciabordio simulati con MPM, insieme a 2.320 video di versamento reali provenienti da filmati stock, più due set di test separati: un benchmark di 1.515 video reali e un benchmark di generalizzazione text-to-first-frame con 18 prompt. Introducono un framework dual-stream image-to-video basato su un generatore video diffusion-transformer pre-addestrato, con l'obiettivo di instillare una dinamica dei fluidi accurata attraverso una supervisione del flusso ottico a doppio flusso, fondendo dati simulati e reali. Il documento è catalogato su arXiv con ID 2607.25321.
Fatti principali
- ID del paper arXiv 2607.25321
- Il dataset include 1.638 video simulati con MPM e 2.320 video di versamento reali
- Set di test esclusi: benchmark reale di 1.515 video e benchmark di generalizzazione con 18 prompt
- Architettura: dual-stream image-to-video su diffusion-transformer pre-addestrato
- Obiettivo: imporre dinamiche dei fluidi basate sulla fisica nella generazione video
Entità
Istituzioni
- arXiv