Leggi di Scaling Orizzontale per Mixture-of-LLMs
Un nuovo articolo su arXiv (2607.22577) propone cMoLLM, un metodo per scalare i modelli linguistici di grandi dimensioni applicando strati stile mixture-of-experts (MoE) lungo l'intera pipeline LLM, non solo nella rete feed-forward. Gli autori riformulano gli strati di miscelazione MoE come convoluzioni dinamiche a kernel variabile, dove ogni esperto è un kernel convoluzionale 1x1 e il routing esegue un'aggregazione del kernel condizionata dall'input. Questo approccio mira a disaccoppiare la capacità dal calcolo, affrontando il collo di bottiglia dei Transformer densi in cui ogni parametro viene attivato per token, causando una crescita lineare dei costi. Approcci precedenti a livello di pipeline come ParaScale e AltUp soffrivano di overhead, routing omogeneizzato, collasso del gradiente, adattività limitata e lenta convergenza. L'articolo stabilisce leggi di scaling per la miscelazione orizzontale di LLM.
Fatti principali
- L'articolo arXiv 2607.22577 introduce cMoLLM.
- cMoLLM applica la miscelazione stile MoE lungo l'intera pipeline LLM.
- I Transformer densi accoppiano capacità e calcolo, attivando tutti i parametri per token.
- Gli strati di miscelazione MoE sono riformulati come convoluzioni dinamiche a kernel variabile.
- Ogni esperto corrisponde a un kernel convoluzionale 1x1.
- Il routing implementa un'aggregazione del kernel condizionata dall'input.
- Gli approcci precedenti ParaScale e AltUp presentavano notevoli svantaggi.
- L'articolo si concentra sulle leggi di scaling orizzontale per mixture-of-LLM.
Entità
Istituzioni
- arXiv