ARTFEED — Contemporary Art Intelligence

HSTGFormer: Un Trasformatore Potenziato da Grafi per la Stima della Posa Umana 3D

other · 2026-08-13

Un nuovo approccio per la stima delle pose umane 3D, chiamato HSTGFormer, è stato presentato in un articolo su arXiv (ID: 2608.12187). Questo metodo affronta i limiti degli attuali modelli basati su trasformatori che separano il ragionamento spaziale e temporale, il che può diminuire l'interconnessione del movimento umano e ridurre i dati strutturali a livello di frame prima dell'analisi temporale. HSTGFormer ridefinisce il ragionamento spazio-temporale attraverso l'aggregazione di grafi accoppiati localizzati sui nodi articolazione-tempo. Presenta un Grafo Iper Spazio-Temporale (HSTG) che scompone il ragionamento globale in campi recettivi localizzati attorno ai nodi articolazione-tempo, espandendo i grafi scheletrici per frame in vicinanze temporali. Ciò consente un ragionamento accoppiato sensibile alla struttura mantenendo i dettagli locali del movimento. È incluso anche un meccanismo adattivo a doppio ramo. L'articolo completo è accessibile all'indirizzo https://arxiv.org/abs/2608.12187.

Fatti principali

  • HSTGFormer è un framework trasformatore potenziato da grafi per la stima della posa umana 3D.
  • Affronta i limiti dei metodi trasformatore esistenti che separano il ragionamento spaziale e temporale.
  • Il metodo introduce un Grafo Iper Spazio-Temporale (HSTG) per l'aggregazione di grafi accoppiati localizzati.
  • HSTG scompone il ragionamento spazio-temporale globale in campi recettivi locali attorno ai nodi articolazione-tempo.
  • Estende i grafi scheletrici per frame in vicinanze temporali per preservare le informazioni strutturali sul movimento.
  • L'articolo è disponibile su arXiv con ID 2608.12187.
  • L'approccio mira a migliorare le interdipendenze spazio-temporali unificate nel movimento umano.
  • L'articolo è un annuncio incrociato, indicando che è stato precedentemente annunciato in un'altra sede.

Entità

Istituzioni

  • arXiv

Fonti