ARTFEED — Contemporary Art Intelligence

I Punteggi dei Benchmark LLM Variano Significativamente con la Scelta del Backend di Inferenza

ai-technology · 2026-08-06

Un nuovo preprint su arXiv (2608.04714) rivela che la scelta del backend di inferenza—come HuggingFace, vLLM o Ollama—può alterare sostanzialmente i punteggi dei benchmark dei modelli linguistici di grandi dimensioni (LLM), anche in condizioni di decodifica greedy deterministica. Lo studio, che è un'analisi completamente incrociata di tre modelli istruiti, cinque framework di inferenza, sei benchmark e quattro modalità di generazione, ha rilevato che la selezione del backend è un fattore non trascurabile che può cambiare significativamente le prestazioni del modello. L'effetto è strutturale e fortemente dipendente dal modello, con una scomposizione della varianza che mostra che circa il 39% della variabilità nei punteggi può essere attribuita alla scelta del backend. Gli autori sostengono che i punteggi dei benchmark sono spesso riportati come proprietà del solo modello, mentre il framework di inferenza utilizzato per produrli è considerato non influente e il suo nome e la sua versione sono raramente divulgati. Questa svista potrebbe portare a confronti fuorvianti e problemi di riproducibilità nella comunità di ricerca sull'IA. L'articolo è disponibile su arXiv con l'identificatore 2608.04714.

Fatti principali

  • Lo studio indaga l'influenza del backend di inferenza sui punteggi dei benchmark LLM.
  • I backend testati includono HuggingFace, vLLM e Ollama.
  • Disegno completamente incrociato: 3 modelli x 5 framework x 6 benchmark x 4 modalità di generazione.
  • La scelta del backend può alterare significativamente le prestazioni anche in condizioni di decodifica greedy.
  • L'effetto è strutturale e fortemente dipendente dal modello.
  • Circa il 39% della variabilità dei punteggi è attribuita alla scelta del backend.
  • L'articolo è disponibile su arXiv con ID 2608.04714.
  • Gli autori chiedono la divulgazione del framework di inferenza nella segnalazione dei benchmark.

Entità

Istituzioni

  • HuggingFace
  • vLLM
  • Ollama

Fonti