ARTFEED — Contemporary Art Intelligence

Ammortizzare il Premio di Ragionamento: Competenze Distillate dalle Traiettorie

ai-technology · 2026-08-11

Una recente sottomissione su arXiv (2608.07885) introduce una tecnica volta a ridurre il carico computazionale associato al ragionamento nei modelli linguistici, estraendo competenze riutilizzabili da traiettorie precedenti. I ricercatori notano che, sebbene le modalità di ragionamento nei modelli linguistici eccellano in compiti agentici multi-step, richiedono da 3 a 6 volte più token di output per episodio, principalmente a causa della necessità di ri-derivare procedure condivise tra episodi di dominio simili. Per mitigare questo problema, un agente di codifica valuta un insieme limitato di traiettorie esistenti da una suddivisione di addestramento e formula una competenza concisa in linguaggio naturale per migliorare il prompt di sistema del modello senza ragionamento. Nei test su quattro benchmark agentici (ALFWorld, tau^2-bench telecomunicazioni e vendita al dettaglio, e SpreadsheetBench-Verified), queste competenze colmano il 55%-100%+ del divario di ragionamento per GPT-5.4-mini su compiti non visti, superando la modalità di ragionamento in due dei quattro benchmark, producendo da 2.7 a 6 volte meno token di output e nessun token di ragionamento. È interessante notare che le competenze derivate esclusivamente da traiettorie senza ragionamento rimangono efficaci, anche senza tracce di ragionamento.

Fatti principali

  • Il documento arXiv:2608.07885 propone di ammortizzare il premio di ragionamento tramite competenze distillate.
  • Le modalità di ragionamento pagano un premio di 3-6 volte i token di output su compiti agentici.
  • Un agente di codifica compila competenze in linguaggio naturale dalle traiettorie di addestramento.
  • Le competenze vengono iniettate nel prompt di sistema del modello senza ragionamento.
  • Valutato su ALFWorld, tau^2-bench (telecomunicazioni e vendita al dettaglio), SpreadsheetBench-Verified.
  • Le competenze recuperano il 55%-100%+ del divario di ragionamento per GPT-5.4-mini.
  • Supera la modalità di ragionamento in due dei quattro benchmark.
  • Emette da 2.7 a 6 volte meno token di output e zero token di ragionamento.
  • Le tracce di ragionamento non sono richieste; le traiettorie senza ragionamento sono sufficienti.
  • Disponibile su arXiv.

Entità

Istituzioni

  • arXiv

Fonti