ARTFEED — Contemporary Art Intelligence

Collasso dell'Impilamento delle Istruzioni: Il Benchmark Rivela il Valore Dipendente dalle Capacità della Compilazione dei Prompt

ai-technology · 2026-08-06

Uno studio recente pubblicato su arXiv (2608.02639) esamina il declino nell'aderenza alle istruzioni nei grandi modelli linguistici man mano che vengono introdotti più vincoli. Valuta tre LLM leader: Claude Sonnet 4.6, GPT-5-mini e Gemini 2.5 Flash, utilizzando fino a 20 istruzioni verificate. I risultati rivelano una significativa caduta non lineare nei tassi di aderenza, che crollano da circa il 96% fino al 20%, principalmente a causa di conflitti strutturati a coppie. Ad esempio, un singolo requisito 'output JSON' non può essere soddisfatto insieme ad altri nove. Inoltre, la ricerca esplora una soluzione senza addestramento: un compilatore di istruzioni che riformula i prompt impilati in una singola chiamata LLM, migliorando le prestazioni fino a +11 punti per i modelli più deboli, che affrontano le maggiori sfide con l'impilamento. Queste intuizioni sono cruciali per l'ingegneria dei prompt e lo sviluppo di sistemi AI, specialmente in scenari che richiedono istruzioni complesse con più vincoli.

Fatti principali

  • Il benchmark impila 24 istruzioni verificate da verificatori, da una a venti alla volta.
  • Valuta Claude Sonnet 4.6, GPT-5-mini e Gemini 2.5 Flash.
  • Il tasso di aderenza scende da circa il 96% fino al 20%.
  • Il degrado è non lineare e guidato da conflitti a coppie.
  • Un singolo vincolo 'output JSON' è congiuntamente insoddisfacibile con altri nove.
  • Il compilatore di istruzioni riscrive il prompt impilato in una singola chiamata LLM.
  • Il compilatore recupera fino a +11 punti di tasso di aderenza per i modelli più deboli.
  • Il beneficio è graduato in base alle capacità.

Entità

Istituzioni

  • arXiv

Fonti