Articolo arXiv sulla Coerenza Latente Multi-Orizzonte nei Predittori Video
C'è questo nuovo preprint su arXiv (2607.21645) che esamina come i modelli di previsione video mantengano la coerenza su diversi orizzonti temporali. Utilizza un peso chiamato lambda per valutare l'allineamento latente multi-step. Quando testato con Moving-MNIST, hanno scoperto che aumentare lambda da 0 a 0,8 riduceva significativamente il proxy di espansione empirica L20 da 4,96 ± 2,01 a 1,01 ± 0,06 (p=0,005) e dimezzava l'errore di previsione all'orizzonte-20 E20 da 0,365 a 0,177 (p=1,1e-13). Sebbene quattro su sei prove abbiano raggiunto L<1 a lambda=0,8, miglioramenti simili non sono stati osservati con Pendulum-v1, CartPole-v1 o KTH Actions condizionati dall'azione. Hanno anche eseguito un'analisi di mediazione su Moving-MNIST, ottenendo r-hat=0,94 (IC 95% [0,88, 1,00], n=27, B=2000), e lambda non è stato randomizzato. Sono stati effettuati controlli difensivi, inclusi basi architetturali e stress test.
Fatti principali
- Articolo: arXiv:2607.21645
- Peso di coerenza latente multi-orizzonte lambda utilizzato come controllo diagnostico
- Su Moving-MNIST, lambda=0,8 riduce L20 da 4,96 a 1,01
- E20 si dimezza da 0,365 a 0,177 su Moving-MNIST
- Quattro dei sei semi raggiungono L<1 a lambda=0,8 su Moving-MNIST
- Nessuna popolazione L<1 su Pendulum-v1, CartPole-v1 o KTH Actions
- Analisi di mediazione su MMNIST: r-hat=0,94, IC 95% [0,88, 1,00]
- I controlli difensivi includono basi architetturali, stress esogeno, WorldTest, MPC
Entità
Istituzioni
- arXiv