APQF: Framework di Compressione Guidato da LLM per Reti Neurali
È stato introdotto un nuovo framework chiamato APQF (Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning) per automatizzare la compressione di reti neurali profonde per dispositivi edge con risorse limitate. Il metodo combina potatura strutturata, addestramento con quantizzazione a precisione mista e recupero dell'accuratezza in un'unica pipeline. Un agente di profilazione misura la distribuzione dei costi e la sensibilità alla potatura attraverso il modello, e queste evidenze guidano i rapporti di potatura per livello, le larghezze di bit e le strategie di recupero, tutte proposte da pianificatori LLM e validate prima dell'esecuzione. Gli autori affermano che APQF è il primo framework a combinare decisioni guidate da LLM e basate su profilazione. L'articolo è disponibile su arXiv con ID 2608.05499, annunciato come invio di tipo cross. Il lavoro affronta la sfida delle scelte di compressione manuali e dipendenti da esperti, la difficoltà di applicare algoritmi su diverse architetture e la perdita di accuratezza dovuta a impostazioni uniformi che ignorano le risposte specifiche dei livelli alla compressione.
Fatti principali
- APQF sta per Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning.
- Il framework combina potatura strutturata, addestramento con quantizzazione a precisione mista e recupero dell'accuratezza.
- Un agente di profilazione misura la distribuzione dei costi e la sensibilità alla potatura.
- I pianificatori LLM propongono rapporti di potatura per livello, larghezze di bit e strategie di recupero.
- Le decisioni vengono validate prima dell'esecuzione.
- L'articolo è disponibile su arXiv con ID 2608.05499.
- Il tipo di annuncio è cross.
- Il framework è destinato a dispositivi edge con risorse limitate.
Entità
Istituzioni
- arXiv