VLM testati per il rilevamento di clipping geometrico nel QA dei videogiochi
Uno studio su arXiv valuta i modelli linguistico-visivi (VLM) per il rilevamento di clipping geometrico nel controllo qualità dei videogiochi. Un agente di esplorazione personalizzato naviga i livelli di gioco per raccogliere osservazioni visive, e una pipeline di annotazione automatica fornisce etichette di clipping a livello di fotogramma. Sei VLM recenti—Gemini, GPT, Qwen, Gemma, Llama e Ministral—vengono confrontati con prompting zero-shot utilizzando quattro varianti di prompt. I risultati mostrano che i VLM possono catturare indizi visivi ma producono falsi positivi sostanziali su fotogrammi ambigui come geometrie quasi a contatto e occlusioni parziali. Gemini-3.1-Flash raggiunge la migliore accuratezza e robustezza alla variazione dei prompt.
Fatti principali
- Lo studio utilizza VLM per il rilevamento di anomalie nel QA dei videogiochi
- Focus sul rilevamento di clipping geometrico
- Agente di esplorazione personalizzato naviga i livelli di gioco
- Pipeline di annotazione automatica fornisce etichette a livello di fotogramma
- Sei VLM confrontati: Gemini, GPT, Qwen, Gemma, Llama, Ministral
- Prompting zero-shot con quattro varianti di prompt
- I VLM producono falsi positivi su fotogrammi ambigui
- Gemini-3.1-Flash raggiunge la migliore accuratezza
Entità
Istituzioni
- arXiv