ARTFEED — Contemporary Art Intelligence

L'esplorazione condizionata da istruzioni migliora l'apprendimento per rinforzo per LLM

ai-technology · 2026-08-04

Un nuovo articolo su arXiv (2608.02087) introduce l'Esplorazione Condizionata da Istruzioni (ICE), un metodo per migliorare l'apprendimento per rinforzo (RL) per modelli linguistici di grandi dimensioni (LLM). Gli autori propongono di integrare i prompt dei compiti con istruzioni distinte durante l'addestramento per aumentare la copertura comportamentale, e combinano RL con auto-distillazione (Asymmetric-RL/SD) per trasferire i comportamenti esplorati alla politica a tempo di test. Esperimenti su Qwen3-1.7B mostrano un miglioramento della prestazione pass@1 su dati non visti a lunghezza di risposta 4K in compiti di ragionamento matematico. L'articolo affronta le sfide nella struttura dello spazio delle azioni degli LLM che differiscono dall'RL classico, sottolineando la necessità di un'esplorazione deliberata che sfrutti la conoscenza pre-addestrata.

Fatti principali

  • L'articolo arXiv 2608.02087 propone l'Esplorazione Condizionata da Istruzioni (ICE).
  • ICE integra i prompt dei compiti con istruzioni distinte durante l'addestramento.
  • Asymmetric-RL/SD combina apprendimento per rinforzo e auto-distillazione.
  • Il metodo migliora la prestazione pass@1 su dati non visti di Qwen3-1.7B a lunghezza di risposta 4K.
  • Focus su compiti di ragionamento matematico.
  • Affronta le sfide dello spazio delle azioni degli LLM nell'RL.
  • Sottolinea l'esplorazione deliberata che utilizza la conoscenza pre-addestrata.
  • L'articolo è annunciato come nuovo su arXiv.

Entità

Istituzioni

  • arXiv

Fonti