ARTFEED — Contemporary Art Intelligence

LongEarth-Bench: Nuovo Benchmark per il Ragionamento sull'Osservazione della Terra a Lungo Orizzonte

ai-technology · 2026-08-15

L'introduzione di LongEarth-Bench segna un avanzamento significativo nei modelli visione-linguaggio per il ragionamento sull'osservazione della Terra a lungo orizzonte. Questo benchmark presenta circa 120.000 istanze di domanda-risposta provenienti da 117.000 immagini distinte, con una media di 15,14 fotogrammi per sequenza, raggiungendo un massimo di 30 fotogrammi. Comprende 12 compiti, tra cui sintesi dell'evoluzione, ragionamento spaziale, rilevamento di anomalie e previsione logica. Un sottoinsieme di 30.000 campioni offre percorsi di ragionamento strutturati che collegano fotogrammi cruciali e aree modificate alle risposte finali. Il modello LongEarth è creato tramite fine-tuning supervisionato, utilizzando identificatori di sequenza espliciti e supervisione strutturata della catena di pensiero. Questa ricerca affronta le carenze degli attuali modelli di telerilevamento visione-linguaggio che si concentrano principalmente su singole immagini, coppie o brevi sequenze. L'articolo è disponibile su arXiv con l'identificatore 2608.13344.

Fatti principali

  • LongEarth-Bench contiene circa 120.000 campioni di domanda-risposta.
  • Il benchmark deriva da 117.000 immagini uniche.
  • Le sequenze hanno una media di 15,14 fotogrammi e si estendono fino a 30 fotogrammi.
  • Copre 12 compiti tra cui sintesi dell'evoluzione, ragionamento spaziale, identificazione di anomalie e previsione logica.
  • Un sottoinsieme di 30.000 campioni fornisce tracce di ragionamento strutturate.
  • Il modello LongEarth è sviluppato tramite fine-tuning supervisionato con identificatori di sequenza espliciti e supervisione strutturata della catena di pensiero.
  • L'articolo è disponibile su arXiv con ID 2608.13344.
  • Il lavoro si concentra sul ragionamento sull'osservazione della Terra a lungo orizzonte, che richiede l'organizzazione dell'evoluzione geografica in più fasi, la localizzazione dei cambiamenti spaziali, il rilevamento di anomalie temporali e l'inferenza del futuro da sequenze di immagini estese.

Entità

Fonti