Intern-S2-Mobius: Disaccoppiare Conoscenza e Ragionamento nei Modelli Fondamentali
Una nuova architettura per i modelli fondamentali, denominata Mobius-v0, è stata presentata dai ricercatori. Questo design innovativo distingue tra funzioni di memorizzazione della conoscenza e funzioni di ragionamento. Presenta una Memoria (FFN) accessibile globalmente per la memorizzazione dei vettori di conoscenza, insieme a più Ragionatori (Self-Attn) che eseguono ragionamento compositivo iterativo. I Ragionatori utilizzano gli stati nascosti sia come cache che come trasportatori, interrogando la memoria per i vettori di conoscenza necessari, che vengono poi trasmessi agli operatori di ragionamento. Questa separazione migliora sia la compressione della conoscenza che l'efficienza del ragionamento. Un modello da 7B addestrato da zero basato su Mobius-v0 eguaglia le prestazioni downstream di un modello Transformer di base da 7B utilizzando solo il 62,6% dei suoi dati di addestramento. Inoltre, Intern-S2-Mobius, preaddestrato in modo continuo da Qwen3.5-35B, raggiunge risultati downstream comparabili con un'inferenza end-to-end quasi 4 volte più veloce. La ricerca è documentata su arXiv nella sezione Computer Science > Artificial Intelligence, contribuendo ai progressi nell'IA e nell'apprendimento automatico.
Fatti principali
- L'architettura Mobius-v0 separa la memorizzazione della conoscenza (FFN) dal ragionamento (Self-Attn).
- Una Memoria condivisa globalmente memorizza i vettori di conoscenza; più Ragionatori eseguono ragionamento compositivo.
- Gli stati nascosti fungono da cache e trasportatori per le query di conoscenza e la trasmissione.
- Un modello da 7B addestrato da zero ottiene punteggi downstream simili a quelli del modello Transformer di base da 7B con il 62,6% dei dati di addestramento.
- Intern-S2-Mobius, preaddestrato in modo continuo da Qwen3.5-35B, ottiene punteggi downstream simili con un'accelerazione end-to-end di quasi 4 volte.
- L'articolo è stato inviato ad arXiv sotto Computer Science > Artificial Intelligence.
- ID arXiv: 2608.14290.
- La ricerca si concentra sul miglioramento della compressione della conoscenza e dell'efficienza del ragionamento nei modelli fondamentali.
Entità
Istituzioni
- arXiv