ARTFEED — Contemporary Art Intelligence

MissionBench: Benchmark per Agenti MLLM Aerei in Compiti a Lungo Termine

ai-technology · 2026-07-27

MissionBench è stato presentato dai ricercatori come un benchmark progettato per valutare i modelli linguistici multimodali di grandi dimensioni (MLLM) che agiscono come agenti incarnati in ambienti 3D aerei. Questo benchmark comprende 120 missioni distribuite in cinque ambienti simulati e quattro categorie di compiti, sfidando gli agenti a pianificare, navigare e riportare i risultati in modo autonomo basandosi esclusivamente su osservazioni egocentriche e sulla cronologia delle loro azioni, senza alcun fine-tuning specifico per compiti aerei. Una valutazione di 22 MLLM, sia open-source che closed-source, ha mostrato che anche il modello con le migliori prestazioni è riuscito a completare meno del 35% delle missioni, mentre le prestazioni umane hanno raggiunto l'84,4%, sottolineando la complessità dei compiti incarnati multi-step. In particolare, l'aumento delle dimensioni dei modelli ha portato a prestazioni migliori, suggerendo che modelli generalisti più grandi mostrano capacità incarnate zero-shot migliorate.

Fatti principali

  • MissionBench è un benchmark per la valutazione a livello di missione degli MLLM in ambienti 3D aerei.
  • Include 120 missioni in cinque ambienti 3D simulati e quattro famiglie di compiti.
  • Gli agenti devono pianificare, navigare e riportare i risultati utilizzando osservazioni egocentriche e cronologia delle azioni.
  • Non è consentito alcun fine-tuning specifico per compiti aerei.
  • Sono stati testati 22 MLLM open-source e closed-source.
  • Il modello più forte ha avuto successo in meno del 35% delle missioni.
  • Le prestazioni umane sono state dell'84,4%.
  • L'aumento delle dimensioni ha migliorato le prestazioni tra le famiglie di modelli.

Entità

Fonti