ARTFEED — Contemporary Art Intelligence

CangjieBench: Nuovo Benchmark per LLM su Linguaggio di Programmazione a Basse Risorse

ai-technology · 2026-08-15

Un nuovo benchmark chiamato CangjieBench è stato sviluppato da ricercatori per valutare i modelli linguistici di grandi dimensioni (LLM) utilizzando Cangjie, un linguaggio di programmazione general-purpose con risorse limitate. Questo benchmark presenta 248 campioni accuratamente tradotti da HumanEval e ClassEval, comprendendo sia compiti text-to-code che code-to-code. L'indagine valuta vari LLM in quattro scenari: generazione diretta, generazione vincolata dalla sintassi, generazione aumentata da recupero (RAG) e agente. I risultati rivelano che la generazione diretta produce risultati insoddisfacenti, mentre la generazione vincolata dalla sintassi raggiunge un equilibrio ottimale tra accuratezza ed efficienza computazionale. Questa ricerca colma una lacuna negli studi precedenti, che si concentravano principalmente su linguaggi specifici del dominio (DSL), trascurando le sfide affrontate dai linguaggi general-purpose. I risultati sottolineano le difficoltà che gli LLM incontrano con linguaggi a basse risorse e propongono la generazione vincolata dalla sintassi come strategia di miglioramento praticabile.

Fatti principali

  • CangjieBench è un benchmark privo di contaminazione per Cangjie, un linguaggio di programmazione general-purpose a basse risorse.
  • Il benchmark include 248 campioni di alta qualità tradotti manualmente da HumanEval e ClassEval.
  • Copre sia compiti Text-to-Code che Code-to-Code.
  • Sono state utilizzate quattro impostazioni di valutazione: Generazione Diretta, Generazione Vincolata dalla Sintassi, Generazione Aumentata da Recupero (RAG) e Agente.
  • La Generazione Diretta ha ottenuto risultati scarsi, mentre la Generazione Vincolata dalla Sintassi ha offerto il miglior compromesso tra accuratezza e costo computazionale.
  • La ricerca esistente sui linguaggi di programmazione a basse risorse si è concentrata sui linguaggi specifici del dominio (DSL), lasciando i linguaggi general-purpose poco esplorati.
  • Lo studio è stato pubblicato su arXiv con l'identificatore 2603.14501.

Entità

Istituzioni

  • arXiv

Fonti