RoboPhD Evolve Programmi Agenti per Dominare Pareto la Competizione LLM
Un recente preprint su arXiv introduce RoboPhD, un meta-agente innovativo progettato per creare programmi agente superiori che eccellono contro i concorrenti su nove endpoint di modelli linguistici di grandi dimensioni (LLM). Questa ricerca enfatizza una strategia per raggiungere l'efficienza di Pareto, rivelando prestazioni migliorate a vari livelli di prezzo, basate su set di addestramento fino a 100 campioni. RoboPhD facilita due compiti principali: generazione di codice e recupero di documenti scientifici. I punteggi ufficiali dimostrano che raggiunge quasi la frontiera di Pareto per entrambe le aree. Utilizzando prompt di task concisi e un agente base semplice, RoboPhD potrebbe influenzare significativamente le dinamiche dei servizi AI nel mercato.
Fatti principali
- RoboPhD è un meta-agente evolutivo che evolve programmi agente completi.
- Opera su un menu di nove endpoint LLM.
- I pool di addestramento consistono al massimo in 100 esempi.
- Si concentra su due compiti: DS-1000 e PaperFindingBench.
- Le sottomissioni con punteggio ufficiale occupano tutti i posti della frontiera di Pareto tranne uno in entrambi i compiti.
- L'approccio utilizza un agente seed semplice e obiettivi di costo scelti dall'operatore.
- Il paper è disponibile su arXiv con ID 2608.16207.
- L'obiettivo è offrire una precisione superiore a ogni punto di prezzo dei concorrenti.
Entità
Istituzioni
- arXiv