Salto di Calcolo Condizionato dal Compito per Acceleratori di Inferenza Multi-Compito
Un nuovo approccio di co-progettazione hardware-software consente il salto di calcolo condizionato dal compito negli acceleratori di inferenza multi-compito. Il metodo utilizza una rete di gating leggera, addestrata congiuntamente con il backbone, per prevedere maschere di esecuzione binarie per tile basate sul comando del compito. Ciò consente di saltare i tile mascherati con overhead zero, riducendo energia e cicli attivando solo il sottoinsieme della rete necessario per ogni compito. L'approccio non modifica l'architettura del modello o la pipeline di inferenza. L'articolo è disponibile su arXiv con ID 2607.22038.
Fatti principali
- 1. I modelli di inferenza multi-compito eseguono calcoli identici indipendentemente dal compito attivo.
- 2. Il comando del compito fornisce un segnale gratuito per saltare calcoli non necessari a livello hardware.
- 3. Una rete di gating leggera prevede maschere di esecuzione binarie per tile condizionate dall'input del compito.
- 4. Ogni tile corrisponde a un gruppo fisso di canali di output (granularità di scheduling nativa).
- 5. I tile mascherati vengono saltati con overhead zero.
- 6. Riduzione del calcolo dipendente dal compito senza modifiche all'architettura del modello o alla pipeline di inferenza.
- 7. La co-progettazione completa del sistema è descritta nell'articolo.
- 8. ID arXiv: 2607.22038
Entità
Istituzioni
- arXiv