ARTFEED — Contemporary Art Intelligence

Nanbeige4.2-3B: Un Modello Compatto da 3B per Compiti Agentici

ai-technology · 2026-07-27

Un team di ricercatori ha presentato Nanbeige4.2-3B, un modello agentico generale compatto con 3 miliardi di parametri non di embedding. Il modello è stato pre-addestrato da zero utilizzando un'architettura Looped Transformer su 28 trilioni di token, consentendo una maggiore capacità senza parametri aggiuntivi. Eccelle in vari compiti, tra cui code-agent, office-agent e uso complesso di strumenti, mostrando anche forti capacità di ragionamento in matematica, programmazione e scienze. Per migliorare i dati di supervised fine-tuning (SFT) e la costruzione di traiettorie, i ricercatori hanno ampliato la diversità degli ambienti eseguibili e delle risorse dei compiti attraverso applicazioni reali e sintesi su larga scala. La loro pipeline di reinforcement learning (RL) incorpora RLHF a modalità mista, RL di ragionamento a lunghezza controllata e RL agentico, portando a prestazioni migliorate e tassi di fallimento ridotti. Valutazioni complete confermano l'efficacia del modello.

Fatti principali

  • Nanbeige4.2-3B ha 3B parametri non di embedding.
  • Pre-addestrato da zero su 28T token.
  • Utilizza Looped Transformer per riutilizzare lo stack di layer.
  • Prestazioni elevate su compiti code-agent, office-agent e uso di strumenti.
  • Ragionamento competitivo in matematica, programmazione e scienze.
  • Dati SFT ampliati tramite implementazione nel mondo reale e sintesi su larga scala.
  • La pipeline RL include RLHF a modalità mista, RL di ragionamento a lunghezza controllata e RL agentico.
  • Il RL agentico utilizza ricompense di risultato e di processo per l'addestramento a lungo orizzonte.

Entità

Fonti