Framework di Potatura Strutturata Hardware-Aware per l'Ottimizzazione degli LLM
Un nuovo articolo di ricerca propone un framework di potatura strutturata multi-obiettivo per modelli linguistici di grandi dimensioni (LLM) per affrontare le sfide di implementazione in ambienti embedded e edge computing. Il metodo ottimizza congiuntamente layer, attention head e dimensioni MLP, mirando alla riduzione della latenza e delle dimensioni del modello. L'approccio in due fasi è hardware-aware e mira a superare i costi computazionali e i problemi di ottimi locali della ricerca esaustiva. L'articolo è disponibile su arXiv con ID 2607.22583.
Fatti principali
- ID arXiv: 2607.22583
- L'articolo propone un framework di potatura strutturata multi-obiettivo hardware-aware
- Mira a latenza e dimensioni del modello per un'implementazione efficiente
- Ottimizza congiuntamente layer, attention head e dimensioni MLP
- Il metodo in due fasi affronta i costi computazionali e gli ottimi locali
- Punta a consentire l'implementazione di LLM su piattaforme embedded e edge
- Gli LLM affrontano vincoli severi di latenza, memoria ed energia in ambienti edge
- L'esplorazione esaustiva delle configurazioni di potatura è computazionalmente costosa
Entità
Istituzioni
- arXiv