Adattamento Black-Box di Modelli Linguistici tramite Bias Logit
I ricercatori propongono un metodo minimale per adattare modelli linguistici a compiti specifici di dominio senza fine-tuning o ingegneria dei prompt. L'approccio utilizza un singolo vettore di bias logit indipendente dal contesto, aggiunto a ogni passo di decodifica, appreso tramite un metodo black-box da un obiettivo di apprendimento per rinforzo regolarizzato con KL. Viene derivato uno stimatore di propensione inversa in forma chiusa da rollout, ricompense e probabilità dei token. Il metodo affronta problemi di privacy evitando la modifica dei pesi del modello. L'articolo è disponibile su arXiv.
Fatti principali
- Il metodo utilizza un singolo vettore di bias logit aggiunto a ogni passo di decodifica
- Apprendimento black-box senza modifica dei pesi del modello o gradienti
- Derivato da un obiettivo di apprendimento per rinforzo regolarizzato con KL
- Stimatore di propensione inversa in forma chiusa da rollout, ricompense e probabilità dei token
- Mira a migliorare le prestazioni su compiti specifici di dominio e affrontare problemi di privacy
- Articolo disponibile su arXiv con ID 2607.22837
Entità
Istituzioni
- arXiv