ARTFEED — Contemporary Art Intelligence

DSpark di DeepSeek accelera l'inferenza AI dell'85%, riducendo il carico sui chip

ai-technology · 2026-06-28

La startup cinese di intelligenza artificiale DeepSeek ha presentato DSpark, un framework di decodifica speculativa che accelera l'inferenza AI fino all'85%, affrontando i colli di bottiglia nel servire modelli di grandi dimensioni. Il framework utilizza un modello leggero di bozza per proporre risposte candidate, che vengono poi verificate in batch da un modello più grande, riducendo i ritardi token per token che portano a un basso utilizzo della GPU e a lunghi tempi di attesa per gli utenti. DSpark impiega anche un metodo di generazione semi-autoregressivo per produrre piccoli blocchi di token anziché singoli token, e un sistema di scheduling basato sulla confidenza che regola dinamicamente la verifica in base alla domanda di calcolo. L'annuncio arriva mentre la Cina spinge per superare le restrizioni statunitensi sui chip avanzati per l'AI. DeepSeek ha pubblicato la ricerca sabato.

Fatti principali

  • DeepSeek ha presentato DSpark, un framework di decodifica speculativa.
  • DSpark accelera l'inferenza AI fino all'85%.
  • Utilizza un modello leggero di bozza per proporre risposte candidate.
  • Un modello più grande verifica i candidati in batch.
  • La generazione semi-autoregressiva produce piccoli blocchi di token.
  • Lo scheduling basato sulla confidenza regola dinamicamente la verifica.
  • Il framework riduce l'utilizzo della GPU e il tempo di attesa percepito dall'utente.
  • La ricerca è stata pubblicata sabato, mentre la Cina spinge per superare le restrizioni statunitensi sull'AI.

Entità

Istituzioni

  • DeepSeek
  • Shutterstock

Luoghi

  • China
  • United States

Fonti