SeGaBench: Benchmarking LLM per Recuperare la Semantica delle Ottimizzazioni del Compilatore
C'è un nuovo studio su arXiv che introduce qualcosa chiamato SeGaBench. È un benchmark progettato per valutare quanto bene i modelli di linguaggio di grandi dimensioni (LLM) possano individuare opportunità di ottimizzazione semantica che i compilatori potrebbero non cogliere. Presenta 100 scenari sintetici e altri 20 basati su codice sorgente reale, concentrandosi su vari aspetti come assunzioni di basso livello e regole sulle strutture dati. Ogni scenario include semantica nascosta, un artefatto oracle e validatori per garantire l'accuratezza. Lo studio esamina cinque diversi LLM, raccogliendo cinque risposte per ogni caso. Il modello migliore ha ottenuto gli artefatti corretti nel 94,8% dei casi, ha gestito almeno un speedup di 1,05x nell'83,3% e ha avuto un'accuratezza del 93,3%. Tuttavia, ha solo parzialmente colmato il divario con l'oracle, indicando che gli LLM non corrispondono completamente alle prestazioni dell'oracle. Puoi trovare il documento con l'identificatore 2608.03983 su arXiv.
Fatti principali
- 1. SeGaBench è un benchmark eseguibile per LLM per recuperare ottimizzazioni mancate dal compilatore.
- 2. Contiene 100 casi sintetici e 20 basati su codice sorgente.
- 3. I casi coprono assunzioni di basso livello, invarianti delle strutture dati e sollevamento semantico di alto livello.
- 4. Ogni caso include semantica abilitante nascosta, un artefatto oracle, validatori e un protocollo di prestazioni.
- 5. Sono stati valutati cinque LLM con cinque risposte indipendenti per caso.
- 6. Il modello più forte ha prodotto artefatti corretti nel 94,8% delle risposte.
- 7. Ha raggiunto almeno un speedup di 1,05x nell'83,3% delle risposte.
- 8. Il successo prestazionale è stato raggiunto nel 93,3% dei casi.
- 9. Gli artefatti corretti spesso colmano solo parte del divario con l'oracle.
- 10. Il documento è su arXiv con ID 2608.03983.
Entità
Istituzioni
- arXiv