ClientMorpher: Federated Fine-Tuning Consapevole del Routing per LLM Eterogenei
È stato proposto un nuovo framework, ClientMorpher, per affrontare le sfide nel fine-tuning federato di istruzioni di modelli linguistici di grandi dimensioni (LLM) basati su Mixture-of-Experts (MoE). Il metodo sfrutta le firme di routing dei modelli MoE pre-addestrati per organizzare la collaborazione tra client, con l'obiettivo di mitigare il trasferimento negativo causato da distribuzioni di istruzioni eterogenee. L'articolo, disponibile su arXiv (2608.15311), evidenzia che i metodi MoE federati esistenti si concentrano sull'aggregazione dei parametri e sulla personalizzazione, trascurando il comportamento di routing come fonte di informazione per la collaborazione tra client. ClientMorpher è progettato come un framework di fine-tuning federato di istruzioni personalizzato e consapevole del routing, che identifica quali client dovrebbero collaborare durante l'ottimizzazione federata. Questo approccio è particolarmente rilevante per scenari di dati decentralizzati sensibili alla privacy, dove la condivisione dei dati non è fattibile. Ci si aspetta che il framework migliori l'efficienza e l'efficacia dell'apprendimento federato con LLM MoE, riducendo i costi di calcolo e comunicazione mentre si scala la capacità del modello.
Fatti principali
- ClientMorpher è un framework di fine-tuning federato di istruzioni personalizzato e consapevole del routing.
- Sfrutta le firme di routing dei modelli MoE pre-addestrati per organizzare la collaborazione tra client.
- Il framework affronta il trasferimento negativo in presenza di distribuzioni di istruzioni eterogenee.
- I metodi MoE federati esistenti trascurano il comportamento di routing per la collaborazione tra client.
- L'articolo è disponibile su arXiv con ID 2608.15311.
- Il fine-tuning federato di istruzioni consente agli LLM di adattarsi a dati decentralizzati e sensibili alla privacy senza condivisione dei dati.
- Gli LLM MoE sono interessanti per l'apprendimento federato grazie all'attivazione sparsa che riduce calcolo e comunicazione.
- Il framework mira a identificare quali client dovrebbero collaborare durante l'ottimizzazione federata.
Entità
—