ARTFEED — Contemporary Art Intelligence

CaRE: Un Protocollo di Valutazione Consapevole del Calcolo per Modelli Linguistici a Diffusione Mascherata

ai-technology · 2026-07-29

Uno studio recente presenta CaRE, un framework progettato per la valutazione di modelli linguistici a diffusione mascherata (MDLM) consapevoli del calcolo. I ricercatori sostengono che i metodi di valutazione esistenti siano insufficienti, poiché sette recenti studi di rimascheratura utilizzano impostazioni incoerenti, differendo per numero di passi, metriche e temperature di campionamento, minando l'affidabilità dei confronti. CaRE affronta questo problema standardizzando il numero di valutazioni di funzione (NFE), imponendo la segnalazione multi-metrica e gestendo la stocasticità. Applicato a sette tecniche di rimascheratura su LLaDA-8B-Base e Dream-7B-Base attraverso quattro livelli di stocasticità e tre budget di passi utilizzando OpenWebText e LM1B, CaRE indica che i miglioramenti riportati potrebbero derivare da artefatti di valutazione piuttosto che da veri progressi algoritmici.

Fatti principali

  • CaRE è un framework di valutazione consapevole del calcolo per MDLM.
  • Sette recenti articoli sulla rimascheratura utilizzano impostazioni di valutazione incompatibili.
  • CaRE standardizza NFE, impone la segnalazione multi-metrica e controlla la stocasticità.
  • Applicato a LLaDA-8B-Base e Dream-7B-Base.
  • Testato sui dataset OpenWebText e LM1B.
  • Valuta 7 strategie di rimascheratura a 4 livelli di stocasticità e 3 budget di passi.
  • I guadagni riportati potrebbero essere artefatti di valutazione.
  • L'articolo è su arXiv con ID 2607.24763.

Entità

Istituzioni

  • arXiv

Fonti