ARTFEED — Contemporary Art Intelligence

L'audit di punteggio NAVSIM v2.2 rivela fallimenti di rollout condivisi

other · 2026-08-06

Uno studio recente pubblicato su arXiv (2608.04896) valuta il sistema di punteggio a stadio singolo della scena originale di NAVSIM v2.2, indicando potenziali problemi con i punteggi di guida difensiva quando viene utilizzato il perdono condizionato dal riferimento. La valutazione ha rivelato che, nella condizione di stack documentata che influisce sul backend numerico, sia la sonda Ignore-All cieca al percorso che la sonda actor-blind consapevole del percorso superano la riproduzione umana e PDM-Closed nell'intera suddivisione navtest di 12.146 token. Inoltre, una nuova installazione basata sulla specifica pubblica mostra divergenza di rollout su un set diagnostico fisso di 32 token. Gli autori sostengono che i punteggi di guida difensiva hanno valore solo quando differenziano tra politiche che riconoscono gli attori circostanti e quelle che non lo fanno. Questo problema sorge quando agente e riferimento condividono una trasformazione di rollout instabile, portando a problemi diffusi di credito di conformità. L'audit include il controllo dello stack di dipendenze dalla stessa fonte e una diagnostica di input esatto. Il documento è stato rilasciato dai ricercatori il 26 agosto 2025.

Fatti principali

  • ID del documento: arXiv:2608.04896
  • Tipo di annuncio: nuovo
  • Audit del sistema di punteggio a stadio singolo della scena originale di NAVSIM v2.2
  • La sonda Ignore-All cieca al percorso e la sonda actor-blind consapevole del percorso superano la riproduzione umana e PDM-Closed
  • Utilizzata l'intera suddivisione navtest di 12.146 token
  • Una nuova installazione riproduce la divergenza di rollout su un set diagnostico fisso di 32 token
  • Inclusi controllo dello stack di dipendenze dalla stessa fonte e diagnostica di input esatto
  • Il perdono condizionato dal riferimento può propagare fallimenti di riferimento condivisi

Entità

Istituzioni

  • arXiv

Fonti