Pipeline Geometria-Prima Supera la Stima della Profondità nel Tracking 3D Multi-Camera
Un nuovo articolo arXiv (2608.07579) presenta un approccio geometria-prima al tracking 3D multi-camera che supera significativamente i metodi basati sulla stima della profondità in un contesto Sim2Real. Lo studio, condotto per l'AI City Challenge 2026 Track 1, si concentra su grandi magazzini interni dove i dati di profondità sono disponibili solo durante l'addestramento e la validazione, forzando l'inferenza solo RGB. Gli autori hanno testato due pipeline solo RGB: un metodo geometria-prima che utilizza rilevamento YOLO11x, sollevamento omografico, prior di dimensione 3D a livello di classe, fusione multi-camera e cucitura di tracklet offline; e un approccio pseudo-LiDAR che retroproietta la profondità monoculare (D4RT, Metric3D v2) in una nuvola di punti fusa per un rilevatore 3D (V-DETR). La pipeline geometria-prima ha raggiunto un 3D HOTA di 13.0 e LocA di 51.6, mentre il metodo pseudo-LiDAR è crollato a 0.12 HOTA e 9.2 LocA. Gli autori attribuiscono il successo alla coerenza geometrica cross-view piuttosto che all'accuratezza della profondità monoculare. L'articolo è disponibile su arXiv.
Fatti principali
- Articolo arXiv:2608.07579
- AI City Challenge 2026 Track 1
- Contesto Sim2Real
- Profondità solo per addestramento/validazione
- Pipeline geometria-prima: YOLO11x, omografia, prior di dimensione 3D, fusione multi-camera, cucitura di tracklet
- Pseudo-LiDAR: D4RT, Metric3D v2, V-DETR
- Geometria-prima: 13.0 3D HOTA, 51.6 LocA
- Pseudo-LiDAR: 0.12 HOTA, 9.2 LocA
Entità
Istituzioni
- arXiv
- AI City Challenge