Ammortizzare il Premio di Ragionamento: Competenze Distillate dalle Traiettorie
Una recente sottomissione su arXiv (2608.07885) introduce una tecnica volta a ridurre il carico computazionale associato al ragionamento nei modelli linguistici, estraendo competenze riutilizzabili da traiettorie precedenti. I ricercatori notano che, sebbene le modalità di ragionamento nei modelli linguistici eccellano in compiti agentici multi-step, richiedono da 3 a 6 volte più token di output per episodio, principalmente a causa della necessità di ri-derivare procedure condivise tra episodi di dominio simili. Per mitigare questo problema, un agente di codifica valuta un insieme limitato di traiettorie esistenti da una suddivisione di addestramento e formula una competenza concisa in linguaggio naturale per migliorare il prompt di sistema del modello senza ragionamento. Nei test su quattro benchmark agentici (ALFWorld, tau^2-bench telecomunicazioni e vendita al dettaglio, e SpreadsheetBench-Verified), queste competenze colmano il 55%-100%+ del divario di ragionamento per GPT-5.4-mini su compiti non visti, superando la modalità di ragionamento in due dei quattro benchmark, producendo da 2.7 a 6 volte meno token di output e nessun token di ragionamento. È interessante notare che le competenze derivate esclusivamente da traiettorie senza ragionamento rimangono efficaci, anche senza tracce di ragionamento.
Fatti principali
- Il documento arXiv:2608.07885 propone di ammortizzare il premio di ragionamento tramite competenze distillate.
- Le modalità di ragionamento pagano un premio di 3-6 volte i token di output su compiti agentici.
- Un agente di codifica compila competenze in linguaggio naturale dalle traiettorie di addestramento.
- Le competenze vengono iniettate nel prompt di sistema del modello senza ragionamento.
- Valutato su ALFWorld, tau^2-bench (telecomunicazioni e vendita al dettaglio), SpreadsheetBench-Verified.
- Le competenze recuperano il 55%-100%+ del divario di ragionamento per GPT-5.4-mini.
- Supera la modalità di ragionamento in due dei quattro benchmark.
- Emette da 2.7 a 6 volte meno token di output e zero token di ragionamento.
- Le tracce di ragionamento non sono richieste; le traiettorie senza ragionamento sono sufficienti.
- Disponibile su arXiv.
Entità
Istituzioni
- arXiv