WuYuEval: Nuovo Benchmark Testa i LLM nella Gestione dei Rifiuti Solidi
I ricercatori hanno introdotto un nuovo strumento di valutazione chiamato WuYuEval, volto a valutare i modelli linguistici di grandi dimensioni (LLM) nella gestione dei rifiuti solidi (SWM). A differenza delle valutazioni esistenti che si concentrano principalmente su conoscenze generali, questo benchmark si concentra sul processo decisionale in contesti ingegneristici, ambientali e politici. WuYuEval comprende due parti: un Modulo Fondamentale con 4.590 domande a scelta multipla su sei tipi di attività e otto domini, e un Modulo Esperto con 247 domande basate su scenari che affrontano l'ottimizzazione multi-obiettivo e la progettazione di sistemi. La valutazione degli esperti utilizza un metodo di punteggio unico con LLM-as-a-Judge e confronti Elo. Il test di 33 LLM ha rivelato notevoli differenze di prestazioni, con il modello leader che ha mostrato risultati eccezionali. Puoi trovare l'articolo di ricerca su arXiv con l'ID 2608.07529.
Fatti principali
- WuYuEval è un benchmark multilivello per valutare i LLM nella gestione dei rifiuti solidi.
- Include un Modulo Fondamentale con 4.590 domande a scelta multipla a risposta chiusa.
- Il Modulo Fondamentale copre sei tipi di attività e otto categorie di domini.
- Un Modulo Esperto contiene 247 domande aperte basate su scenari.
- I compiti degli esperti coinvolgono ottimizzazione multi-obiettivo, compromessi vincolati e progettazione di sistemi.
- La valutazione utilizza punteggio LLM-as-a-Judge calibrato con ancoraggio e confronto a coppie basato su Elo.
- Sono stati testati 33 LLM, mostrando un'ampia variazione delle prestazioni.
- L'articolo è disponibile su arXiv (2608.07529).
Entità
Istituzioni
- arXiv