ARTFEED — Contemporary Art Intelligence

Benchmark Energetico di LLM Deployati Localmente su GPU Consumer

ai-technology · 2026-08-04

C'è un nuovo preprint su arXiv (2608.00008) che presenta un benchmark energetico riproducibile per nove modelli linguistici di grandi dimensioni (LLM) open-source, ciascuno con parametri che vanno da 1 miliardo a 7 miliardi. I test sono stati condotti su una singola GPU consumer, la RTX 4060Ti con 16GB. Lo studio si concentra sui costi energetici spesso trascurati dell'esecuzione di LLM in locale, utilizzando il motore di inferenza Ollama e monitorando la potenza della GPU a una frequenza di 2Hz tramite nvidia-smi. Le metriche chiave valutate includono potenza media e di picco, energia utilizzata per prompt (in joule), energia per token di output e throughput. I risultati rivelano che l'efficienza energetica varia in base al design del modello e alla quantizzazione, con gemma3:1b e llama3.2:1b che hanno i costi energetici più bassi e il throughput più alto. Questa ricerca mira a colmare una lacuna nelle valutazioni degli LLM che tipicamente enfatizzano l'accuratezza rispetto al consumo energetico, fornendo un quadro per studi futuri.

Fatti principali

  • Il preprint arXiv:2608.00008 annuncia una nuova ricerca sull'efficienza energetica degli LLM distribuiti localmente.
  • Il benchmark copre nove LLM open-source con parametri da 1B a 7B.
  • Hardware utilizzato: una singola GPU consumer (RTX 4060Ti 16GB).
  • Motore di inferenza: Ollama; assorbimento di potenza campionato a 2Hz tramite nvidia-smi.
  • Metriche: potenza media/picco, J/prompt, J/token, tok/s.
  • gemma3:1b e llama3.2:1b hanno avuto il costo energetico più basso (0.56 e 0.65 J/token) e il throughput più alto (>170 tok/s).
  • L'efficienza energetica è guidata dall'architettura del modello e dalla quantizzazione, non solo dal numero di parametri.
  • Lo studio affronta la mancanza di benchmark energetici per l'inferenza LLM on-premise.

Entità

Istituzioni

  • arXiv
  • Ollama

Fonti