La distillazione del protocollo multi-agente colma il divario distributivo nella ricerca agentica
Un nuovo articolo su arXiv (2607.24280) introduce il Multi-Agent Protocol Distillation (MAPD), un framework che combina knowledge distillation e reinforcement learning per migliorare la ricerca agentica nei modelli linguistici di grandi dimensioni. La ricerca agentica alterna ragionamento multi-step e recupero di informazioni per compiti ad alta intensità di conoscenza, ma l'RL basato sui risultati fornisce solo una supervisione sparsa. MAPD affronta il problema della distillazione eterogenea utilizzando un protocollo strutturato e normalizzato nello stile come rappresentazione intermedia, consentendo la distillazione da modelli proprietari nonostante logit nascosti e tokenizer non corrispondenti. Il framework impiega una configurazione multi-agente offline per colmare il divario distributivo tra modelli proprietari e open-source, evitando artefatti stilistici superficiali derivanti dall'imitazione grezza delle traiettorie. L'articolo propone MAPD come un framework congiunto di distillazione e RL che densifica i segnali di supervisione senza richiedere l'accesso ai logit.
Fatti principali
- L'articolo arXiv 2607.24280 introduce il Multi-Agent Protocol Distillation (MAPD)
- MAPD combina knowledge distillation e reinforcement learning per la ricerca agentica
- La ricerca agentica alterna ragionamento multi-step e recupero di informazioni
- L'RL basato sui risultati fornisce solo una supervisione sparsa
- MAPD utilizza un protocollo strutturato e normalizzato nello stile come rappresentazione intermedia
- Affronta il problema della distillazione eterogenea da modelli proprietari
- Logit nascosti e tokenizer non corrispondenti impediscono il tradizionale logit-matching
- Il framework impiega una configurazione multi-agente offline
Entità
Istituzioni
- arXiv