ARTFEED — Contemporary Art Intelligence

Il post-addestramento sulle azioni riduce la decodificabilità della profondità nei VLM: uno studio su Molmo2-ER e MolmoAct2-LIBERO

ai-technology · 2026-08-17

Un recente articolo su arXiv (2608.08904) esplora l'influenza del post-addestramento sulle azioni sulla comprensione spaziale dei modelli visione-linguaggio (VLM) nello sviluppo di un modello visione-linguaggio-azione (VLA). Lo studio esamina la percezione della profondità, un aspetto fondamentale della comprensione spaziogeometrica, attraverso ogni strato del decodificatore di una coppia VLM/VLA open-source abbinata: Molmo2-ER e MolmoAct2-LIBERO. I risultati rivelano che il VLA mostra una decodifica della profondità peggiore in tutti gli strati, un deficit costante definito 'pavimento'. Inoltre, questo declino è incoerente; mentre la decodificabilità della profondità del VLM di base migliora nei suoi strati successivi, il VLA subisce un calo, definito 'scogliera'. I ricercatori identificano l'interferenza MLP negli strati tardivi come causa di questa scogliera, notando che la rimozione delle scritture MLP negli strati tardivi migliora significativamente la decodificabilità, a differenza di interventi simili nel VLM di base. Questo studio fa luce sui compromessi associati al post-addestramento sulle azioni e sui suoi effetti sulle capacità percettive.

Fatti principali

  • Articolo arXiv:2608.08904v2, tipo di annuncio replace-cross.
  • Sonda la percezione della profondità da ogni strato del decodificatore di Molmo2-ER (VLM di base) e MolmoAct2-LIBERO (VLA).
  • Il VLA decodifica la profondità peggio in ogni strato, definito 'pavimento'.
  • Il VLM di base migliora la decodificabilità della profondità negli strati finali, mentre il VLA crolla, definito 'scogliera'.
  • La scogliera è causalmente localizzata all'interferenza MLP negli strati tardivi.
  • L'ablazione delle scritture MLP negli strati tardivi recupera la maggior parte del deficit terminale di decodificabilità.
  • Ablazioni di attenzione abbinate e lo stesso intervento nel VLM di base non producono un recupero comparabile.
  • La scomposizione a livello di modulo spiega la dissociazione.

Entità

Istituzioni

  • arXiv

Fonti