MecEng: Nuovo Benchmark Testa gli LLM su Ingegneria Meccanica e Geometria Spaziale
È stato introdotto un nuovo benchmark automatizzato chiamato MecEng per valutare quanto bene i Large Language Models (LLM) comprendano la meccanica e la geometria spaziale, che i creatori definiscono 'consapevolezza dell'ingegneria meccanica'. Mentre gli LLM sono abili nei tradizionali compiti di codifica e matematica, la loro capacità di creare modelli di simulazione multicorpo da descrizioni testuali non era stata valutata prima. MecEng colma questa lacuna con un sistema automatizzato che include 84 compiti divisi in tre livelli di complessità. Questi compiti coinvolgono sistemi a corpo rigido con giunti e sistemi multicorpo flessibili che richiedono una generazione accurata della geometria 3D e altri processi complessi. Il benchmark mira a testare a fondo la comprensione dei principi dell'ingegneria meccanica da parte degli LLM. Puoi consultare l'articolo di ricerca su arXiv con ID 2608.14615.
Fatti principali
- MecEng è un benchmark completamente automatizzato per valutare gli LLM sulla consapevolezza dell'ingegneria meccanica.
- Il benchmark include 84 compiti generici su tre livelli di difficoltà.
- I compiti vanno da sistemi a corpo rigido a sistemi multicorpo flessibili che richiedono generazione di geometria 3D e mesh a elementi finiti.
- La pipeline utilizza Netgen per la generazione della geometria e Exudyn per la costruzione di modelli di sistemi multicorpo.
- La verifica rispetto alla verità di base esperta include l'isomorfismo del grafo di sistema.
- L'articolo è disponibile su arXiv con identificatore 2608.14615.
- Il benchmark affronta una lacuna nella valutazione degli LLM oltre i benchmark di codice e matematica.
Entità
Istituzioni
- arXiv