MACRO: Routing a Catena di Markov per l'Esecuzione Efficiente dei Layer dei Transformer
È stato introdotto un nuovo framework chiamato MACRO (Markov Chain Routing of Transformer Layers) per migliorare le prestazioni dei Large Language Models (LLM) attraverso il routing dinamico dei layer. A differenza dei LLM tradizionali che elaborano i layer in modo lineare, MACRO consente l'apprendimento di percorsi specifici per compito senza alterare i parametri del modello. Concettualizza il routing dei layer come una politica di Markov sensibile al contesto, influenzata dagli indici dei layer, dalle fasi del budget computazionale, dai cambi di direzione e dal contesto dell'operatore, facilitando operazioni come skip, repeat e addizione residua degli stati nascosti. La distribuzione del percorso di Markov viene raffinata utilizzando il feedback dei dati di addestramento e decodificata con un algoritmo Viterbi top-k per individuare percorsi ad alta probabilità. Questo metodo mira a migliorare l'efficienza senza richiedere aggiornamenti dei pesi, costosi cicli di ricerca per istanza o etichette di verità di base durante l'inferenza. La ricerca è disponibile su arXiv con l'identificatore 2608.05872.
Fatti principali
- 1. MACRO sta per Markov Chain Routing of Transformer Layers.
- 2. È un framework per il routing dinamico dei layer nei LLM.
- 3. Non modifica i parametri sottostanti del modello.
- 4. Supporta operazioni di skip, repeat e addizione residua degli stati nascosti.
- 5. Il routing è modellato come una politica di Markov dipendente dal contesto.
- 6. Utilizza un algoritmo Viterbi top-k per la decodifica.
- 7. L'articolo è su arXiv con ID 2608.05872.
- 8. L'approccio evita di aggiornare i pesi, costosi cicli di ricerca e etichette di verità di base durante l'inferenza.
Entità
Istituzioni
- arXiv