ARTFEED — Contemporary Art Intelligence

Backtrader-Bench: Valutazione degli Agenti LLM nel Trading Algoritmico con MCQ Auto-Generate

ai-technology · 2026-08-13

È stato presentato un nuovo framework di valutazione, Backtrader-Bench, per migliorare la valutazione degli agenti di codifica basati su grandi modelli linguistici (LLM) nel trading algoritmico. Pubblicato in un articolo arXiv (2608.11232), affronta le carenze dei benchmark statici che possono distorcere le prestazioni. Il framework comprende due componenti: una pipeline di domande a scelta multipla che attinge a cinque strategie di trading e vari modelli, e una pipeline generatore-risolutore, progettata per creare domande impegnative che richiedono l'esecuzione di codice per le risposte. Nei test, i modelli assistiti da strumenti, tra cui GPT-5.5 e Opus 4.7, hanno raggiunto un tasso di accuratezza impressionante del 90,0%, indicando un progresso significativo nelle metodologie di valutazione.

Fatti principali

  • Backtrader-Bench è un nuovo benchmark per valutare gli agenti di codifica LLM nel trading algoritmico.
  • Utilizza due pipeline: generazione deterministica di MCQ e filtraggio generatore-risolutore.
  • La pipeline MCQ copre cinque strategie di trading, 33 modelli e tre livelli di difficoltà.
  • Un verificatore indipendente ricalcola ogni risposta nella pipeline deterministica.
  • La pipeline di filtraggio generatore-risolutore estrae domande più difficili scartando quelle risolvibili senza esecuzione di codice.
  • Sono stati valutati 11 modelli senza strumenti (10 esecuzioni ciascuno) e quattro configurazioni con strumenti.
  • Gli agenti potenziati con strumenti hanno raggiunto un'accuratezza del 90,0% in una singola passata.
  • GPT-5.5 e Opus 4.7 hanno ottenuto la massima accuratezza tra i modelli testati.
  • Il benchmark mira a ridurre la contaminazione dei dati e garantire la verità di base dall'esecuzione del codice.
  • L'articolo è disponibile su arXiv con ID 2608.11232.

Entità

Istituzioni

  • arXiv

Fonti