CALM: Addestrare LLM a Cooperare con Diversi Controller di Inferenza
Un nuovo approccio di post-addestramento noto come CALM (Controller-Aware Language Models) affronta le discrepanze tra la fase di addestramento e il deployment dei grandi modelli linguistici (LLM). Le tecniche di post-addestramento esistenti si concentrano sull'ottimizzazione di un singolo stile di interazione fisso, mentre le applicazioni reali richiedono una gamma di controller, tra cui Chain-of-Thought, auto-consistenza, dibattito, pianificazione e processi di verifica. CALM integra i controller direttamente nel ciclo di addestramento, trattando il post-addestramento consapevole dei controller come apprendimento per rinforzo multi-task basato su protocolli di interazione modellati dai controller. Questi controller sono composti da moduli di ragionamento locale riutilizzabili, consentendo una scomposizione modulare dell'addestramento con controller misti sotto un obiettivo GRPO a livello di turno. Questa metodologia migliora l'adattabilità a nuovi flussi di lavoro e favorisce una migliore collaborazione con vari controller di inferenza.
Fatti principali
- CALM è un framework di post-addestramento per LLM.
- Affronta il disallineamento tra addestramento e deployment causato da diversi controller di inferenza.
- I controller includono Chain-of-Thought, auto-consistenza, dibattito, pianificazione e verifica.
- CALM utilizza l'apprendimento per rinforzo multi-task su protocolli indotti dai controller.
- I controller sono composti da moduli di ragionamento locale riutilizzabili.
- L'addestramento utilizza un obiettivo GRPO a livello di turno.
- Il framework migliora il trasferimento a nuovi flussi di lavoro.
- L'articolo è disponibile su arXiv con ID 2607.23771.
Entità
Istituzioni
- arXiv