ARTFEED — Contemporary Art Intelligence

A-3PO: Approssimazione Prossimale delle Politiche Sensibile alla Staleness Accelera l'Addestramento Asincrono di LLM

ai-technology · 2026-08-13

Un nuovo articolo su arXiv (ID 2512.06547) introduce A-3PO (APproximated Proximal Policy Optimization), un metodo per accelerare l'addestramento asincrono di grandi modelli linguistici (LLM) sotto apprendimento per rinforzo (RL). L'articolo, intitolato "A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation," affronta il sovraccarico computazionale in PPO disaccoppiato, una variante di PPO progettata per contesti RL asincroni. Il PPO disaccoppiato migliora la stabilità dell'apprendimento utilizzando una politica prossimale per disaccoppiare la correzione off-policy dai vincoli di aggiornamento della politica, ma ciò richiede un passaggio in avanti aggiuntivo per ogni passo di addestramento. A-3PO approssima la politica prossimale tramite semplice interpolazione, eliminando il sovraccarico e ottenendo un'accelerazione di 1,8 volte mantenendo le prestazioni. L'approccio si basa sull'osservazione che la politica prossimale funge solo da ancora di regione di fiducia tra le politiche di comportamento e target. L'articolo è disponibile su https://arxiv.org/abs/2512.06547.

Fatti principali

  • ID articolo: arXiv:2512.06547
  • Titolo: A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation
  • Metodo: A-3PO (APproximated Proximal Policy Optimization)
  • A-3PO approssima la politica prossimale tramite semplice interpolazione
  • Elimina il passaggio in avanti aggiuntivo nel PPO disaccoppiato
  • Ottiene un'accelerazione dell'addestramento di 1,8 volte
  • Mantiene le prestazioni mentre accelera l'addestramento
  • Articolo disponibile su https://arxiv.org/abs/2512.06547

Entità

Istituzioni

  • arXiv

Fonti