ARTFEED — Contemporary Art Intelligence

ParaGUIBench: Benchmark per il Coordinamento Parallelo di Agenti GUI

ai-technology · 2026-07-29

I ricercatori hanno introdotto ParaGUIBench, il primo benchmark per l'esecuzione parallela e il coordinamento di più agenti GUI. Questi agenti, basati su grandi modelli multimodali (LMM), eseguono azioni come clic e digitazione su desktop e dispositivi mobili. Gli agenti attuali faticano con compiti a lungo termine a causa delle costose inferenze LMM e del degrado delle prestazioni. ParaGUIBench consente il coordinamento parallelo tra agenti su istanze desktop separate, ispirandosi alla collaborazione umana. Include un'infrastruttura Docker multi-dispositivo con un file system condiviso, un dataset di 233 compiti in sei categorie e un sistema di valutazione con metriche di efficienza come la riduzione dei passaggi. Questo lavoro colma una lacuna nella ricerca sugli agenti GUI, mirando a migliorare scalabilità e prestazioni.

Fatti principali

  • ParaGUIBench è il primo benchmark per l'esecuzione parallela e il coordinamento di più agenti GUI.
  • Gli agenti GUI sono basati su grandi modelli multimodali (LMM).
  • Gli agenti attuali scalano male per compiti a lungo termine a causa delle costose inferenze LMM e della crescita del contesto.
  • Il benchmark include un'infrastruttura Docker multi-dispositivo con un file system condiviso.
  • Il dataset contiene 233 compiti suddivisi in sei categorie.
  • Il sistema di valutazione include metriche di efficienza come la riduzione dei passaggi.
  • Il coordinamento parallelo tra agenti GUI ha ricevuto poca attenzione prima di questo lavoro.
  • L'approccio è ispirato alla divisione umana dei carichi di lavoro tra collaboratori.

Entità

Istituzioni

  • arXiv

Fonti