ARTFEED — Contemporary Art Intelligence

CosmosAlign: Adattamento del Modello Fondazionale Mondiale per la Previsione Video del Traffico

ai-technology · 2026-08-11

È stato presentato un nuovo framework denominato CosmosAlign per la previsione generativa di video del traffico. Questo sistema genera video futuri di scene di traffico a lungo termine e temporalmente coerenti basandosi su brevi storie di osservazione e input testuali. Utilizza il modello fondazionale mondiale preaddestrato Cosmos3-Nano. La metodologia evidenzia che adattare efficacemente grandi modelli mondiali preaddestrati per compiti di previsione dipende più dall'allineamento della distribuzione che dal potenziamento della capacità del modello. Per raggiungere questo obiettivo, viene introdotta una strategia di adattamento LoRA in due fasi: la prima fase allinea la distribuzione della modalità di condizionamento con il compito di previsione target, mentre la seconda fase sincronizza le didascalie di addestramento con l'interfaccia di prompting strutturato del modello tramite un processo di ri-didascalizzazione basato su LLM. La qualità della previsione durante l'inferenza è migliorata attraverso un metodo di campionamento basato sul consenso senza addestramento. La ricerca è disponibile su arXiv con l'identificatore 2608.07693.

Fatti principali

  • CosmosAlign è un framework per la previsione generativa di video del traffico.
  • Si basa sul modello fondazionale mondiale preaddestrato Cosmos3-Nano.
  • L'approccio enfatizza l'allineamento della distribuzione rispetto alla capacità del modello.
  • Viene proposta una strategia di adattamento LoRA in due fasi.
  • La prima fase allinea la distribuzione della modalità di condizionamento con il compito di previsione.
  • La seconda fase allinea le didascalie di addestramento con l'interfaccia di prompting strutturato nativa del modello.
  • Un processo di ri-didascalizzazione basato su LLM viene utilizzato per l'allineamento delle didascalie.
  • Una procedura basata sul consenso senza addestramento migliora la qualità dell'inferenza.
  • L'articolo è disponibile su arXiv con l'identificatore 2608.07693.

Entità

Istituzioni

  • arXiv

Fonti