Motif 3: Un Modello Linguistico Mixture-of-Experts con 314 Miliardi di Parametri
Quindi, c'è un nuovo report su arXiv riguardante un modello linguistico chiamato Motif 3. È un modello decoder-only con ben 314 miliardi di parametri, ma solo 13,2 miliardi vengono utilizzati per ogni token. Il modello presenta una caratteristica chiamata Grouped Differential Latent Attention, che combina diverse tecniche di attenzione. Include anche connessioni speciali e attivazioni per migliorare prestazioni ed efficienza. Motif 3 è stato addestrato su circa 12,5 trilioni di token provenienti da varie fonti come siti web, campi STEM e diverse lingue. Utilizza una struttura unica con 384 esperti in ogni strato, attivandone otto alla volta. Il report tocca anche il bilanciamento degli esperti e la stabilizzazione dei numeri, sebbene l'abstract non sia completamente dettagliato. Questo modello rappresenta un avanzamento significativo nella tecnologia linguistica!
Fatti principali
- Motif 3 è un modello linguistico Mixture-of-Experts decoder-only.
- Ha 314 miliardi di parametri totali e 13,2 miliardi attivati per token.
- Ogni strato MoE sparso contiene 384 esperti instradati, con otto selezionati per token.
- L'architettura utilizza Grouped Differential Latent Attention (GDLA).
- Include iper-connessioni modificate vincolate a varietà, attivazioni Expert Specific PolyNorm e previsione multi-token.
- Pre-addestrato su circa 12,5 trilioni di token.
- I dati di addestramento includono documenti web, STEM, codice, matematica, contenuti multilingue e corpora specializzati per dominio.
- Il report è disponibile su arXiv con ID 2608.09119.
Entità
Istituzioni
- arXiv