Nanbeige4.2-3B: Un Modello Compatto da 3B per Compiti Agentici
Un team di ricercatori ha presentato Nanbeige4.2-3B, un modello agentico generale compatto con 3 miliardi di parametri non di embedding. Il modello è stato pre-addestrato da zero utilizzando un'architettura Looped Transformer su 28 trilioni di token, consentendo una maggiore capacità senza parametri aggiuntivi. Eccelle in vari compiti, tra cui code-agent, office-agent e uso complesso di strumenti, mostrando anche forti capacità di ragionamento in matematica, programmazione e scienze. Per migliorare i dati di supervised fine-tuning (SFT) e la costruzione di traiettorie, i ricercatori hanno ampliato la diversità degli ambienti eseguibili e delle risorse dei compiti attraverso applicazioni reali e sintesi su larga scala. La loro pipeline di reinforcement learning (RL) incorpora RLHF a modalità mista, RL di ragionamento a lunghezza controllata e RL agentico, portando a prestazioni migliorate e tassi di fallimento ridotti. Valutazioni complete confermano l'efficacia del modello.
Fatti principali
- Nanbeige4.2-3B ha 3B parametri non di embedding.
- Pre-addestrato da zero su 28T token.
- Utilizza Looped Transformer per riutilizzare lo stack di layer.
- Prestazioni elevate su compiti code-agent, office-agent e uso di strumenti.
- Ragionamento competitivo in matematica, programmazione e scienze.
- Dati SFT ampliati tramite implementazione nel mondo reale e sintesi su larga scala.
- La pipeline RL include RLHF a modalità mista, RL di ragionamento a lunghezza controllata e RL agentico.
- Il RL agentico utilizza ricompense di risultato e di processo per l'addestramento a lungo orizzonte.
Entità
—