OSCD: Cross-Distillation per il Ragionamento in Lingue del Sud-Est Asiatico a Basse Risorse
È stato sviluppato un nuovo algoritmo chiamato Onramp-Sequence Cross-Distillation (OSCD) per affrontare il problema del collasso cross-linguistico nei Large Language Models (LLM) quando si impegnano in ragionamenti complessi in lingue del Sud-Est asiatico a basse risorse. Questo approccio traduce i percorsi di ragionamento ad alte risorse in sottospazi di vocabolario a basse risorse durante i rollout di training generativo, utilizzando un ciclo agentico di traduttore integrato per garantire una traduzione stabile ed efficace dei campioni di riferimento prodotti dinamicamente per il fine-tuning. Inoltre, presenta un allineamento semantico congiunto delle rappresentazioni tra le tracce di ragionamento di riferimento e quelle nella lingua target, colmando efficacemente il divario cross-linguistico. La tecnica mira ad alleviare il collo di bottiglia del cold-start per l'ottimizzazione delle politiche e a evitare il dimenticare catastrofico dovuto a cambiamenti nella rappresentazione cross-linguistica. I risultati sono presentati in un articolo su arXiv (2608.00533), enfatizzando il ragionamento nativo multilingue a catena di pensiero in contesti a basse risorse.
Fatti principali
- OSCD è un algoritmo di post-training per LLM.
- Affronta il collasso cross-linguistico nelle lingue del Sud-Est asiatico a basse risorse.
- Utilizza un ciclo agentico di traduttore integrato durante i rollout di training generativo.
- Proietta le traiettorie di ragionamento ad alte risorse in sottospazi di vocabolario a basse risorse.
- Include l'allineamento semantico congiunto delle rappresentazioni delle tracce di ragionamento.
- Mira a risolvere il collo di bottiglia del cold-start per l'ottimizzazione delle politiche.
- Previene il dimenticare catastrofico dovuto alla deriva della rappresentazione cross-linguistica.
- Articolo disponibile su arXiv con ID 2608.00533.
Entità
Istituzioni
- arXiv