ARTFEED — Contemporary Art Intelligence

CRUISE: Fusione di sensori robusta per la guida autonoma guidata da VLM e consapevole dell'incertezza

ai-technology · 2026-08-11

Un articolo di ricerca intitolato 'CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving' è stato pubblicato su arXiv (arXiv:2608.09202v1). Affronta il problema della fusione efficace delle caratteristiche cross-modali nelle auto a guida autonoma, che dipendono da vari sensori come telecamere, LiDAR e radar per comprendere l'ambiente circostante. Le prestazioni di questi sensori possono variare notevolmente in diversi scenari del mondo reale, come scarsa visibilità e condizioni meteorologiche avverse. Sebbene la quantificazione dell'incertezza (UQ) possa aiutare i modelli a concentrarsi su segnali affidabili, i metodi attuali spesso si basano su valutazioni di incertezza a livello di caratteristiche di base che faticano in situazioni complesse fuori distribuzione. Per affrontare questo problema, gli autori introducono CRUISE, un framework che utilizza un modulo UQ guidato da un modello visione-linguaggio (VLM) per stime di incertezza dettagliate a livello di pixel, migliorando l'affidabilità della fusione dei sensori in ambienti difficili. Questo articolo è classificato come una nuova sottomissione su arXiv.

Fatti principali

  • Titolo dell'articolo: CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving
  • Pubblicato su arXiv con ID 2608.09202v1
  • Affronta la fusione di sensori cross-modali nei veicoli autonomi
  • I sensori includono telecamere, LiDAR e radar
  • Le sfide includono scarsa visibilità e condizioni meteorologiche avverse
  • I metodi esistenti di fusione consapevole dell'incertezza utilizzano stime semplici a livello di caratteristiche
  • CRUISE integra un modulo UQ guidato da VLM per l'incertezza a livello di pixel
  • Sfrutta la ricca conoscenza a priori del VLM

Entità

Istituzioni

  • arXiv

Fonti