Penelope: Ragionamento Latente Efficiente per Transformers
Penelope introduce un nuovo framework per Transformers decoder-only preaddestrati che confina il calcolo ricorrente a un segmento decoder designato, facilitando un ragionamento strutturato efficiente senza espandere la dimensione dei parametri o dipendere dalla serializzazione dei token chain-of-thought. Inizialmente, il prefisso decoder inferiore viene valutato per creare una memoria di confine condizionata al problema, che viene poi progressivamente migliorata utilizzando dinamiche GRU modulate temporalmente e stati di readout ricorrenti prima di generare le risposte. Un curriculum graduale CoT-to-latent trasferisce il ragionamento osservabile in questo percorso ricorrente interno, permettendo ulteriore computazione nello spazio latente senza dover eseguire l'intero decode ripetutamente. Questa strategia riduce i costi di addestramento e implementazione, preservando l'efficacia del ragionamento.
Fatti principali
- Penelope è introdotto come un framework efficiente di ragionamento latente per Transformers decoder-only preaddestrati
- Localizza il calcolo ricorrente a un intervallo decoder selezionato
- Il prefisso decoder inferiore viene valutato una volta per costruire una memoria di confine condizionata al problema
- La memoria viene iterativamente raffinata attraverso dinamiche GRU modulate temporalmente e stati di readout ricorrenti
- Un curriculum progressivo CoT-to-latent trasferisce il ragionamento visibile nel percorso ricorrente interno
- Permette computazione aggiuntiva nello spazio latente senza eseguire ripetutamente l'intero decode
- L'approccio riduce i costi di addestramento e implementazione
- Evita di aumentare la scala dei parametri o di dipendere dalla serializzazione dei token chain-of-thought
Entità
—