RooflineBench: Benchmarking di LLM su Dispositivi con Analisi Roofline
È stato introdotto un nuovo framework di benchmarking, RooflineBench, per valutare le prestazioni di grandi modelli linguistici (LLM) e piccoli modelli linguistici (SLM) su hardware edge. Il framework, descritto in un articolo su arXiv (2602.11506), utilizza il modello Roofline per unificare i primitivi architetturali e i vincoli hardware attraverso l'intensità operativa (OI). Definisce una regione di potenziale di inferenza e introduce una nuova metrica, il Potenziale di Inferenza Relativo, per confrontare le differenze di efficienza tra LLM sullo stesso hardware. Un'ampia analisi empirica su diversi livelli di calcolo rivela che le variazioni di prestazioni e OI sono significativamente influenzate dalla lunghezza della sequenza, e viene identificata una regressione critica nell'OI. Il lavoro affronta la sfida di misurare oggettivamente i limiti teorici di prestazioni di architetture diverse su piattaforme eterogenee, cruciale per la transizione verso l'intelligenza localizzata.
Fatti principali
- Framework denominato RooflineBench
- Basato sul modello Roofline
- Introduce la metrica Potenziale di Inferenza Relativo
- Usa l'intensità operativa (OI) come lente
- Analisi empirica su diversi livelli di calcolo
- La lunghezza della sequenza influenza significativamente prestazioni e OI
- Identifica una regressione critica nell'OI
- Articolo su arXiv con ID 2602.11506
Entità
Istituzioni
- arXiv