ARTFEED — Contemporary Art Intelligence

Nuovo framework riduce le allucinazioni nel GUI grounding tramite matching layout-aware

ai-technology · 2026-08-11

Un nuovo articolo di ricerca su arXiv (2608.09654) propone un framework senza regressione per affrontare le allucinazioni nel GUI grounding, un compito in cui gli agenti AI traducono le istruzioni degli utenti in coordinate precise dello schermo. Il framework utilizza un modello linguistico multimodale di grandi dimensioni (MLLM) congelato per l'analisi delle istruzioni e un modello dedicato di GUI grounding layout-aware per la localizzazione, evitando la regressione delle coordinate. Questo approccio mira a migliorare la percezione fine-grained nei MLLM, che spesso allucinano le coordinate a causa di una comprensione visiva deficitaria. L'articolo è stato annunciato su arXiv con il titolo 'Hallucination-Free GUI Grounding via Regression-Free Layout-Aware Matching'.

Fatti principali

  • L'articolo è intitolato 'Hallucination-Free GUI Grounding via Regression-Free Layout-Aware Matching'.
  • È disponibile su arXiv con identificatore 2608.09654.
  • Il framework utilizza un MLLM congelato per l'analisi delle istruzioni.
  • Un modello di grounding dedicato esegue la localizzazione senza regressione.
  • L'approccio mira a ridurre le allucinazioni delle coordinate nei MLLM.
  • Il compito è il GUI grounding, che traduce le istruzioni in coordinate degli elementi.
  • Il framework è descritto come 'Layout-Aware'.
  • L'articolo è stato annunciato come un nuovo tipo su arXiv.

Entità

Istituzioni

  • arXiv

Fonti