SLM come Router Multi-Agente: Approccio Progressivo con SFT e RL
Un nuovo articolo di ricerca su arXiv (2608.00030) propone di addestrare un piccolo modello linguistico (SLM) per agire come router multi-agente, selezionando agenti di recupero specializzati e generando parametri strutturati per chiamate a strumenti a valle. L'approccio utilizza il fine-tuning supervisionato seguito da apprendimento per rinforzo, con una funzione di ricompensa gerarchica che bilancia la rilevanza del recupero e l'allineamento tematico query-agente. Questo metodo affronta i limiti del routing basato sull'intento incorporando il feedback dal contenuto recuperato, consentendo al modello di apprendere l'idoneità dell'agente in base al compito. L'articolo è scritto da ricercatori (nomi non forniti) ed è stato annunciato come una sottomissione di tipo incrociato. Il lavoro è rilevante per i domini dell'IA-tecnologia e digitale, offrendo un potenziale miglioramento nei sistemi di recupero.
Fatti principali
- Articolo su arXiv: 2608.00030
- Addestra un piccolo modello linguistico (SLM) come router multi-agente
- Utilizza fine-tuning supervisionato e apprendimento per rinforzo
- Esegue congiuntamente la selezione dell'agente e la generazione di parametri strutturati
- Funzione di ricompensa gerarchica basata sulla rilevanza del recupero e l'allineamento tematico
- Affronta i limiti del routing basato sull'intento
- Incorpora il segnale dal contenuto recuperato
- Annunciato come sottomissione di tipo incrociato
Entità
Istituzioni
- arXiv