Diffusion Transformers: analisi dei gradienti di addestramento ridimensionati
Un recente articolo su arXiv (2608.04448v1) esplora l'impatto dell'addestramento di diffusion transformers con immagini ridimensionate sulla preservazione del segnale di gradiente originale. Gli autori analizzano la variazione del gradiente dovuta al ridimensionamento, scomponendola in due componenti: una influenzata dal rumore e dal rapporto di ridimensionamento, che diminuisce a livelli di rumore elevati come indicato dall'analisi spettrale, e una seconda, un pavimento costante, legato al conteggio assoluto di token della griglia target, non influenzato dal rumore. Le loro intuizioni teoriche sono supportate da mappe (route, sigma), che rivelano strutture aggiuntive non evidenti nell'analisi spettrale. Ad esempio, durante il processo di ridimensionamento 1024->768, individuano un intervallo (0.65 < sigma < 0.95) che i criteri spettrali non prevedono. Lo studio affronta anche i crescenti costi di addestramento associati a risoluzioni più elevate, un ostacolo significativo nell'addestramento di modelli di diffusione. I risultati indicano che, sebbene il ridimensionamento possa mantenere i segnali di gradiente a livelli di rumore elevati, esiste una limitazione fondamentale dovuta al conteggio dei token, che influisce sull'efficacia del ridimensionamento a rumore più basso. Questa ricerca migliora la comprensione delle condizioni in cui l'addestramento ridimensionato rispecchia l'addestramento a piena risoluzione, con implicazioni significative per l'addestramento efficiente di modelli di generazione di immagini ad alta risoluzione.
Fatti principali
- L'articolo arXiv:2608.04448v1 analizza la preservazione del gradiente nell'addestramento ridimensionato di diffusion transformers.
- La variazione del gradiente sotto ridimensionamento si scompone in un termine dipendente dal rumore e un pavimento indipendente da sigma.
- Il termine dipendente dal rumore decade a rumore elevato, coerente con le premesse spettrali.
- Il pavimento indipendente da sigma è governato dal conteggio assoluto di token della griglia target.
- Le mappe (route, sigma) misurate corroborano la spiegazione teorica.
- Sulla rotta 1024->768, viene identificata una finestra (0.65 < sigma < 0.95) che l'analisi spettrale non prevede.
- Il costo di addestramento dei diffusion transformers cresce superlinearmente con la risoluzione.
- L'articolo affronta questioni irrisolte sul segnale di gradiente nell'addestramento ridimensionato.
Entità
Istituzioni
- arXiv