Pipeline ibrida di stima dell'attenzione per l'interazione adattiva uomo-robot
Uno studio pubblicato su arXiv (2608.00284) esplora la stima ibrida dell'attenzione visiva per l'interazione uomo-robot, utilizzando una testa robotica espressiva dell'ecosistema InMoov. Questo approccio innovativo combina un rapido strato di percezione geometrica con un separato strato di percezione semantica che impiega un modello visione-linguaggio. Lo strato geometrico fornisce dati ad alta frequenza sulla posa del viso e della testa per regolazioni temporali, mentre lo strato semantico elabora i fotogrammi grezzi della telecamera egocentrica per generare etichette di attenzione contestuali, indicando l'attenzione sul robot, l'uso del telefono o altre distrazioni. Una macchina a stati finiti integra questi segnali per gestire comportamenti interattivi adattivi, come attivazione, attesa, ripresa dell'interazione e ritorno a riposo. Il sistema è stato valutato con 10 partecipanti in 40 prove, dimostrando un'avvio dell'interazione coerente in tutti gli scenari.
Fatti principali
- Articolo arXiv:2608.00284
- Pipeline ibrida di stima dell'attenzione visiva
- Testa robotica espressiva basata sull'ecosistema InMoov
- Combina strati di percezione geometrica e semantica
- Modello visione-linguaggio per lo strato semantico
- Macchina a stati finiti per l'interazione adattiva
- Valutato con 10 partecipanti e 40 prove
- I risultati mostrano un avvio affidabile dell'interazione
Entità
Istituzioni
- arXiv
- InMoov