RLCascadeRouter: Apprendimento per Rinforzo per il Routing a Cascata Senza Stimatori di Qualità
Il framework RLCascadeRouter, recentemente presentato in un articolo arXiv (2608.15817v1), affronta il problema di indirizzare efficacemente le query tra modelli linguistici di grandi dimensioni (LLM) con capacità e costi di inferenza variabili. I metodi di routing tradizionali mancano di flessibilità: i router one-shot prendono decisioni prima di analizzare le risposte, mentre le cascate standard, sebbene adattive, aderiscono a una sequenza di modelli predeterminata. Rivalutando se fermarsi o coinvolgere un altro modello dopo ogni risposta, il routing a cascata elimina queste limitazioni. Le tecniche attuali si basano su un approccio predict-then-optimize, che non equipara la perdita di previsione alla perdita di decisione di routing. RLCascadeRouter, tuttavia, è un framework che ottimizza direttamente le scelte di routing attraverso l'apprendimento per rinforzo, eliminando la necessità di stimatori di qualità. L'articolo evidenzia il suo obiettivo di migliorare i compromessi prestazioni-costi nel panorama in espansione degli LLM.
Fatti principali
- RLCascadeRouter è un framework senza stimatori di qualità per il routing a cascata.
- Utilizza l'apprendimento per rinforzo per ottimizzare le decisioni di routing.
- I router one-shot esistenti si impegnano prima di osservare le risposte.
- Le cascate convenzionali si fermano in modo adattivo ma seguono un ordine di modelli fisso.
- Il routing a cascata rimuove le restrizioni riconsiderando le decisioni di stop o invocazione dopo ogni risposta.
- I metodi attuali usano una pipeline predict-then-optimize che stima la qualità della risposta e l'utilità futura del modello.
- La perdita di previsione per qualità o utilità non è equivalente alla perdita di decisione di routing.
- L'articolo è disponibile su arXiv con ID 2608.15817v1.
Entità
Istituzioni
- arXiv