ARTFEED — Contemporary Art Intelligence

CoPES: Evoluzione Cooperativa per il Post-Addestramento Efficiente di Agenti LLM

ai-technology · 2026-08-04

È stato sviluppato un nuovo approccio noto come Strategia di Evoluzione Cooperativa del Sottospazio dei Parametri (CoPES) per affrontare le sostanziali richieste di GPU-ore delle strategie di evoluzione (ES) nel post-addestramento di agenti basati su modelli linguistici di grandi dimensioni (LLM), specialmente in situazioni con risorse limitate. Questa tecnica suddivide l'intero spazio dei parametri in sottospazi più piccoli e gestibili e collabora su di essi per migliorare l'efficienza dell'ottimizzazione. La ricerca ha coinvolto il post-addestramento di un agente Qwen3.5-4B per l'uso di strumenti in compiti matematici, testandolo su cinque benchmark di diversi livelli di difficoltà. L'articolo è disponibile su arXiv con ID 2608.02391. CoPES mira a raggiungere prestazioni comparabili all'apprendimento per rinforzo (RL) basato su gradienti, essendo efficiente in termini di memoria, poiché ES consente un post-addestramento completo dei parametri senza retropropagazione. In ambienti con GPU limitate, tuttavia, gli elevati requisiti di GPU-ore di ES possono portare a tempi di addestramento eccessivamente lunghi. CoPES cerca di mitigare questo problema attraverso l'evoluzione cooperativa, che si prevede riduca i tempi di addestramento mantenendo le prestazioni. Questo studio riveste importanza nei campi dell'IA e dell'apprendimento automatico, in particolare per migliorare gli agenti LLM in contesti con risorse limitate.

Fatti principali

  • CoPES è un metodo di evoluzione cooperativa per il post-addestramento di agenti LLM.
  • Decompone l'intero spazio dei parametri in sottospazi a dimensione inferiore.
  • Il metodo è progettato per contesti con risorse limitate e poche GPU.
  • Il post-addestramento viene eseguito su un agente Qwen3.5-4B per l'uso di strumenti in compiti matematici.
  • La valutazione viene effettuata su cinque benchmark di diversa difficoltà.
  • L'articolo è disponibile su arXiv con ID 2608.02391.
  • ES consente un post-addestramento completo dei parametri efficiente in termini di memoria senza retropropagazione.
  • CoPES mira a eguagliare le prestazioni del RL basato su gradienti riducendo i requisiti di GPU-ore.

Entità

Istituzioni

  • arXiv

Fonti