StepReflect: Riflessione Strutturata per Agenti GUI Mobili
StepReflect, un nuovo modello di intelligenza artificiale, è stato lanciato per migliorare la precisione degli agenti GUI mobili attraverso una riflessione strutturata su ogni azione intrapresa. I ricercatori hanno descritto il suo sviluppo in un articolo disponibile su arXiv (ID: 2608.05587). Questo modello affronta la riflessione come una sfida di predizione strutturata supervisionata, utilizzando specifiche di transizione esplicite insieme a dati visivi accoppiati. La sua formazione prevede un processo a fasi che incorpora la messa a punto supervisionata, la distillazione insegnante-studente e il perfezionamento basato su preferenze e ricompense. Nei test offline su AndroidWorld, il modello da 8 miliardi di parametri ha raggiunto un'accuratezza a livello di transizione dell'82,16%, superando il GPT-5.2 zero-shot di 11,83 punti percentuali con input strutturati identici. Nelle valutazioni online su M3A, Agent-SAMA, MAI-UI-8B e Seed-2.0-Pro, StepReflect ha dimostrato un successo superiore nei compiti in tre delle quattro configurazioni, mantenendo una prestazione ravvicinata nella quarta. Questo avanzamento affronta le sfide associate agli alti costi e alle incoerenze del ragionamento multimodale a risposta aperta per le transizioni di stato GUI, fornendo una soluzione più efficace per i compiti mobili a lungo termine.
Fatti principali
- StepReflect è un nuovo modello per la riflessione degli agenti GUI mobili.
- Utilizza la predizione strutturata supervisionata con specifiche di transizione e prove visive.
- Addestrato tramite messa a punto supervisionata, distillazione e perfezionamento basato su preferenze/ricompense.
- Raggiunge un'accuratezza a livello di transizione dell'82,16% su AndroidWorld.
- Supera il GPT-5.2 zero-shot di 11,83 punti percentuali.
- Successo online in 3 delle 4 configurazioni di agenti (M3A, Agent-SAMA, MAI-UI-8B, Seed-2.0-Pro).
- Articolo disponibile su arXiv con ID 2608.05587.
- Punta a ridurre i costi e migliorare l'accuratezza rispetto al ragionamento a risposta aperta.
Entità
Istituzioni
- arXiv