ARTFEED — Contemporary Art Intelligence

L'apprendimento per rinforzo riduce il consumo energetico dei data center AI: controllo misurato della potenza nell'addestramento di LLM

ai-technology · 2026-08-13

Un recente articolo su arXiv (2608.11226) introduce un metodo di apprendimento per rinforzo volto a minimizzare il consumo energetico nei data center AI durante l'addestramento di grandi modelli linguistici (LLM). Concentrandosi sull'addestramento GRPO, la ricerca impiega telemetria di potenza a mezzo secondo su varie scale di 7B, 14B e 72B parametri utilizzando da una a quattro GPU A100, accumulando oltre 380.000 punti dati. Un meta-controller PPO modifica i parametri di generazione del carico di lavoro in base alle misurazioni di potenza, ottenendo una riduzione dell'89,8% delle violazioni del limite di potenza, un aumento del 18,1% della produzione di token e un miglioramento del 26,2% dell'efficienza energetica (token per MWh) rispetto a una traccia completa di 500 passi a 7B. Tuttavia, i test dal vivo alla scala 72B hanno prodotto risultati nulli simili, attribuiti all'attuatore della dimensione del gruppo che perde il controllo durante lo sharding del modello. Una scansione dell'autorità dell'attuatore suggerisce che l'uso degli stessi parametri della concorrenza di generazione mantiene 17-... L'articolo sottolinea le carenze dei sistemi di gestione dell'energia esistenti che non tengono conto del carico di lavoro e sostiene una strategia più sofisticata e consapevole del carico di lavoro.

Fatti principali

  • Articolo arXiv 2608.11226
  • L'apprendimento per rinforzo post-addestramento domina lo sviluppo dei moderni modelli linguistici
  • Il comportamento energetico su hardware GPU non era stato precedentemente caratterizzato
  • I data center gestiscono l'energia delle GPU con meccanismi ciechi al carico di lavoro: limiti statici e throttling reattivo
  • Addestramento GRPO strumentato con telemetria di potenza a mezzo secondo a scale 7B, 14B e 72B
  • Utilizzate da una a quattro A100, raccogliendo oltre 380.000 campioni
  • Addestrato un meta-controller PPO che adatta i parametri di generazione del carico di lavoro alla potenza misurata
  • Il controller riduce le violazioni del limite di potenza dell'89,8%, aumenta la produzione di token del 18,1% e migliora l'efficienza energetica del 26,2% (token per MWh) rispetto alla traccia completa di 500 passi a 7B
  • La distribuzione dal vivo a 72B ha prodotto risultati nulli replicati, diagnosticati come perdita di autorità dell'attuatore della dimensione del gruppo sotto sharding del modello
  • La scansione dell'autorità dell'attuatore mostra che gli stessi parametri applicati alla concorrenza di generazione mantengono 17-

Entità

Istituzioni

  • arXiv

Fonti