ARTFEED — Contemporary Art Intelligence

ProGPO: Nuovo Metodo per Addestrare Agenti LLM su Compiti a Lungo Orizzonte

other · 2026-07-29

I ricercatori propongono Progress-conditioned Group Policy Optimization (ProGPO) per affrontare la trappola del credito nell'addestramento di agenti basati su grandi modelli linguistici (LLM) su compiti a lungo orizzonte. L'ottimizzazione standard basata su gruppi soffre di uno squilibrio di campionamento in cui azioni ripetute a basso effetto dominano, portando a gruppi di rollout completamente falliti che non forniscono alcun segnale correttivo. ProGPO utilizza la copertura delle osservazioni al primo accesso quando tutti i campioni in un gruppo ricevono una ricompensa zero, rompendo il ciclo auto-rinforzante. Il metodo è descritto in arXiv:2607.22724.

Fatti principali

  • ProGPO sta per Progress-conditioned Group Policy Optimization.
  • Affronta la trappola del credito nell'addestramento di agenti LLM.
  • L'ottimizzazione standard basata su gruppi soffre di squilibrio di campionamento.
  • Azioni ripetute a basso effetto dominano le regioni ad alta probabilità.
  • I gruppi di rollout completamente falliti non forniscono correzione basata sui risultati.
  • ProGPO utilizza la copertura delle osservazioni al primo accesso quando tutti i campioni ottengono ricompensa zero.
  • Il metodo è descritto nell'articolo arXiv 2607.22724.
  • L'articolo è stato annunciato su arXiv con tipo cross.

Entità

Istituzioni

  • arXiv

Fonti