STAIF: Ottimizzazione a Stadi per il Seguimento di Istruzioni Complesse nei LLM
Un nuovo framework chiamato STAIF è stato introdotto dai ricercatori per migliorare la capacità dei grandi modelli linguistici di seguire istruzioni complesse che coinvolgono molteplici vincoli. Questo approccio separa l'allineamento dei vincoli morbidi soggettivi dall'ottimizzazione dei vincoli duri che possono essere verificati oggettivamente. Nella Fase 1, viene utilizzata l'ottimizzazione delle preferenze con vari campioni negativi per aumentare la sensibilità ai vincoli morbidi. La Fase 2 implementa l'Apprendimento per Rinforzo con Ricompense Verificabili (RLVR) per garantire la stretta aderenza ai vincoli duri. Per facilitare questa ricerca, gli autori hanno sviluppato STAINSTRUCT, un dataset bilingue composto da circa 31.000 istruzioni complesse con vincoli multipli in inglese e cinese. L'articolo critica le tecniche di allineamento esistenti come DPO, che tendono a privilegiare i segnali di ricompensa complessivi e spesso trascurano il soddisfacimento dei singoli vincoli, specialmente in scenari con vincoli multipli o fuori distribuzione.
Fatti principali
- STAIF è un framework di ottimizzazione a stadi per il seguimento di istruzioni
- Fase 1: ottimizzazione delle preferenze con campioni negativi multipli per vincoli morbidi
- Fase 2: RLVR per vincoli duri
- Dataset STAINSTRUCT: circa 31.000 istruzioni complesse bilingue (inglese, cinese)
- Affronta le limitazioni di DPO in contesti con vincoli multipli
- Pubblicato su arXiv con ID 2607.22649
Entità
Istituzioni
- arXiv