ARTFEED — Contemporary Art Intelligence

SkillTV-Bench: Nuovo Benchmark per la Verifica dell'Esecuzione Agentica Consapevole delle Competenze

ai-technology · 2026-08-07

È stato introdotto un nuovo benchmark, SkillTV-Bench, per valutare le prestazioni dei giudici nella verifica di esecuzioni agentiche potenziate da competenze. Il benchmark comprende 681 casi di traiettorie reali di agenti provenienti da 50 compiti in undici domini. È progettato per valutare sia i metodi LLM-as-a-Judge che Agent-as-a-Judge nella verifica di traiettorie consapevoli delle competenze. Il framework associato SkillTV-Evolve esternalizza la conoscenza di verifica come JudgeSkill riutilizzabile, guidando i giudici agenti a pianificare strategie di verifica efficaci. Questo sviluppo affronta il passaggio dalla valutazione basata sul punteggio della risposta finale alla verifica delle esecuzioni complete, incorporando la conoscenza procedurale codificata nelle competenze al momento del compito. Il benchmark è dettagliato in un articolo su arXiv (arXiv:2608.05573), annunciato come nuova sottomissione.

Fatti principali

  • SkillTV-Bench include 681 casi di traiettorie reali di agenti.
  • Il benchmark copre 50 compiti in undici domini.
  • Valuta i metodi LLM-as-a-Judge e Agent-as-a-Judge.
  • SkillTV-Evolve esternalizza la conoscenza di verifica come JudgeSkill riutilizzabile.
  • L'articolo è disponibile su arXiv con ID 2608.05573.
  • Il benchmark si concentra sulla verifica dell'esecuzione agentica potenziata da competenze.
  • Sposta la valutazione dal punteggio della risposta finale alla verifica delle esecuzioni complete.
  • Il benchmark incorpora la conoscenza procedurale dalle competenze al momento del compito.

Entità

Istituzioni

  • arXiv

Fonti