ARTFEED — Contemporary Art Intelligence

DeaMoE: Architettura MoE Efficiente per Decodifica Veloce in Piccoli Batch

ai-technology · 2026-08-17

Un nuovo articolo su arXiv (2608.14385) introduce DeaMoE, un'architettura Mixture-of-Experts (MoE) efficiente per la decodifica, progettata per affrontare il collo di bottiglia legato alla memoria nella decodifica in piccoli batch, che è critica per applicazioni interattive in tempo reale come assistenti di codifica e sistemi di interazione audio-video. Gli autori notano che le soluzioni esistenti, come la compressione dei pesi post-addestramento o la progettazione fine-grained degli esperti, o degradano l'accuratezza o aggiungono overhead. DeaMoE raggruppa gli esperti in dipartimenti, dove gli esperti dello stesso dipartimento condividono la maggior parte dei parametri grazie alla sovrapposizione dei loro campi professionali. L'articolo è annunciato come una sottomissione di tipo 'cross', indicando che potrebbe essere stato presentato altrove. La ricerca mira a migliorare la velocità di inferenza senza sacrificare la qualità del modello, potenzialmente a beneficio di applicazioni sensibili alla latenza.

Fatti principali

  • DeaMoE è proposto come architettura MoE efficiente per la decodifica.
  • L'articolo è disponibile su arXiv con ID 2608.14385.
  • La ricerca affronta i colli di bottiglia legati alla memoria nella decodifica in piccoli batch.
  • Le soluzioni esistenti come la compressione post-addestramento o la progettazione fine-grained degli esperti vengono criticate.
  • DeaMoE raggruppa gli esperti in dipartimenti con parametri condivisi.
  • L'architettura è pensata per applicazioni interattive in tempo reale.
  • Il tipo di annuncio è 'cross'.
  • L'articolo si concentra sulla riduzione della latenza nell'inferenza MoE.

Entità

Istituzioni

  • arXiv

Fonti