I Punteggi dei Benchmark LLM Variano Significativamente con la Scelta del Backend di Inferenza
Un nuovo preprint su arXiv (2608.04714) rivela che la scelta del backend di inferenza—come HuggingFace, vLLM o Ollama—può alterare sostanzialmente i punteggi dei benchmark dei modelli linguistici di grandi dimensioni (LLM), anche in condizioni di decodifica greedy deterministica. Lo studio, che è un'analisi completamente incrociata di tre modelli istruiti, cinque framework di inferenza, sei benchmark e quattro modalità di generazione, ha rilevato che la selezione del backend è un fattore non trascurabile che può cambiare significativamente le prestazioni del modello. L'effetto è strutturale e fortemente dipendente dal modello, con una scomposizione della varianza che mostra che circa il 39% della variabilità nei punteggi può essere attribuita alla scelta del backend. Gli autori sostengono che i punteggi dei benchmark sono spesso riportati come proprietà del solo modello, mentre il framework di inferenza utilizzato per produrli è considerato non influente e il suo nome e la sua versione sono raramente divulgati. Questa svista potrebbe portare a confronti fuorvianti e problemi di riproducibilità nella comunità di ricerca sull'IA. L'articolo è disponibile su arXiv con l'identificatore 2608.04714.
Fatti principali
- Lo studio indaga l'influenza del backend di inferenza sui punteggi dei benchmark LLM.
- I backend testati includono HuggingFace, vLLM e Ollama.
- Disegno completamente incrociato: 3 modelli x 5 framework x 6 benchmark x 4 modalità di generazione.
- La scelta del backend può alterare significativamente le prestazioni anche in condizioni di decodifica greedy.
- L'effetto è strutturale e fortemente dipendente dal modello.
- Circa il 39% della variabilità dei punteggi è attribuita alla scelta del backend.
- L'articolo è disponibile su arXiv con ID 2608.04714.
- Gli autori chiedono la divulgazione del framework di inferenza nella segnalazione dei benchmark.
Entità
Istituzioni
- HuggingFace
- vLLM
- Ollama