CaRE: Un Protocollo di Valutazione Consapevole del Calcolo per Modelli Linguistici a Diffusione Mascherata
Uno studio recente presenta CaRE, un framework progettato per la valutazione di modelli linguistici a diffusione mascherata (MDLM) consapevoli del calcolo. I ricercatori sostengono che i metodi di valutazione esistenti siano insufficienti, poiché sette recenti studi di rimascheratura utilizzano impostazioni incoerenti, differendo per numero di passi, metriche e temperature di campionamento, minando l'affidabilità dei confronti. CaRE affronta questo problema standardizzando il numero di valutazioni di funzione (NFE), imponendo la segnalazione multi-metrica e gestendo la stocasticità. Applicato a sette tecniche di rimascheratura su LLaDA-8B-Base e Dream-7B-Base attraverso quattro livelli di stocasticità e tre budget di passi utilizzando OpenWebText e LM1B, CaRE indica che i miglioramenti riportati potrebbero derivare da artefatti di valutazione piuttosto che da veri progressi algoritmici.
Fatti principali
- CaRE è un framework di valutazione consapevole del calcolo per MDLM.
- Sette recenti articoli sulla rimascheratura utilizzano impostazioni di valutazione incompatibili.
- CaRE standardizza NFE, impone la segnalazione multi-metrica e controlla la stocasticità.
- Applicato a LLaDA-8B-Base e Dream-7B-Base.
- Testato sui dataset OpenWebText e LM1B.
- Valuta 7 strategie di rimascheratura a 4 livelli di stocasticità e 3 budget di passi.
- I guadagni riportati potrebbero essere artefatti di valutazione.
- L'articolo è su arXiv con ID 2607.24763.
Entità
Istituzioni
- arXiv