ARTFEED — Contemporary Art Intelligence

StepReflect: Riflessione Strutturata per Agenti GUI Mobili

ai-technology · 2026-08-07

StepReflect, un nuovo modello di intelligenza artificiale, è stato lanciato per migliorare la precisione degli agenti GUI mobili attraverso una riflessione strutturata su ogni azione intrapresa. I ricercatori hanno descritto il suo sviluppo in un articolo disponibile su arXiv (ID: 2608.05587). Questo modello affronta la riflessione come una sfida di predizione strutturata supervisionata, utilizzando specifiche di transizione esplicite insieme a dati visivi accoppiati. La sua formazione prevede un processo a fasi che incorpora la messa a punto supervisionata, la distillazione insegnante-studente e il perfezionamento basato su preferenze e ricompense. Nei test offline su AndroidWorld, il modello da 8 miliardi di parametri ha raggiunto un'accuratezza a livello di transizione dell'82,16%, superando il GPT-5.2 zero-shot di 11,83 punti percentuali con input strutturati identici. Nelle valutazioni online su M3A, Agent-SAMA, MAI-UI-8B e Seed-2.0-Pro, StepReflect ha dimostrato un successo superiore nei compiti in tre delle quattro configurazioni, mantenendo una prestazione ravvicinata nella quarta. Questo avanzamento affronta le sfide associate agli alti costi e alle incoerenze del ragionamento multimodale a risposta aperta per le transizioni di stato GUI, fornendo una soluzione più efficace per i compiti mobili a lungo termine.

Fatti principali

  • StepReflect è un nuovo modello per la riflessione degli agenti GUI mobili.
  • Utilizza la predizione strutturata supervisionata con specifiche di transizione e prove visive.
  • Addestrato tramite messa a punto supervisionata, distillazione e perfezionamento basato su preferenze/ricompense.
  • Raggiunge un'accuratezza a livello di transizione dell'82,16% su AndroidWorld.
  • Supera il GPT-5.2 zero-shot di 11,83 punti percentuali.
  • Successo online in 3 delle 4 configurazioni di agenti (M3A, Agent-SAMA, MAI-UI-8B, Seed-2.0-Pro).
  • Articolo disponibile su arXiv con ID 2608.05587.
  • Punta a ridurre i costi e migliorare l'accuratezza rispetto al ragionamento a risposta aperta.

Entità

Istituzioni

  • arXiv

Fonti