ProGPO: Nuovo Metodo per Addestrare Agenti LLM su Compiti a Lungo Orizzonte
I ricercatori propongono Progress-conditioned Group Policy Optimization (ProGPO) per affrontare la trappola del credito nell'addestramento di agenti basati su grandi modelli linguistici (LLM) su compiti a lungo orizzonte. L'ottimizzazione standard basata su gruppi soffre di uno squilibrio di campionamento in cui azioni ripetute a basso effetto dominano, portando a gruppi di rollout completamente falliti che non forniscono alcun segnale correttivo. ProGPO utilizza la copertura delle osservazioni al primo accesso quando tutti i campioni in un gruppo ricevono una ricompensa zero, rompendo il ciclo auto-rinforzante. Il metodo è descritto in arXiv:2607.22724.
Fatti principali
- ProGPO sta per Progress-conditioned Group Policy Optimization.
- Affronta la trappola del credito nell'addestramento di agenti LLM.
- L'ottimizzazione standard basata su gruppi soffre di squilibrio di campionamento.
- Azioni ripetute a basso effetto dominano le regioni ad alta probabilità.
- I gruppi di rollout completamente falliti non forniscono correzione basata sui risultati.
- ProGPO utilizza la copertura delle osservazioni al primo accesso quando tutti i campioni ottengono ricompensa zero.
- Il metodo è descritto nell'articolo arXiv 2607.22724.
- L'articolo è stato annunciato su arXiv con tipo cross.
Entità
Istituzioni
- arXiv