ARTFEED — Contemporary Art Intelligence

Il Benchmark EnterpriseRAG Espone il Collasso dell'Adesione alle Istruzioni degli LLM in Produzione

ai-technology · 2026-08-13

Il nuovo benchmark, EnterpriseRAG, evidenzia un problema di affidabilità significativo nelle implementazioni di retrieval-augmented generation (RAG) aziendali. Sebbene i modelli linguistici di grandi dimensioni (LLM) soddisfino l'80% dei criteri individuali, solo il 26,8% dei loro output soddisfa tutte le condizioni contemporaneamente, rivelando un deficit di orchestrazione di 57 punti. I benchmark attuali operano sotto l'assunzione di query semplici con recupero pulito, trascurando le complessità degli scenari del mondo reale che coinvolgono documenti rumorosi e vincoli multidimensionali. Documentato in un articolo su arXiv (2608.11584), EnterpriseRAG presenta 983 esempi validati da esperti in sei domini, simulando efficacemente tre modalità di fallimento trascurate negli studi precedenti: rumore di recupero, carenze di conoscenza e discrepanze fattuali, insieme a istruzioni complesse. Una valutazione di 13 LLM leader scopre un calo significativo nell'aderenza alle istruzioni, dove l'elevata soddisfazione dei vincoli individuali oscura la scarsa conformità complessiva, rivelando ostacoli sostanziali legati a lacune di conoscenza e incoerenze fattuali, anche con capacità di ragionamento potenziate, indicando la necessità di ulteriori miglioramenti nel RAG di produzione.

Fatti principali

  • Gli LLM soddisfano l'80% dei vincoli individuali ma solo il 26,8% delle risposte soddisfa tutti i requisiti, un divario di orchestrazione di 57 punti.
  • EnterpriseRAG è un nuovo benchmark con 983 campioni validati da esperti in sei domini.
  • Il benchmark simula tre modalità di fallimento: rumore di recupero, lacune di conoscenza e conflitti fattuali.
  • La valutazione di 13 LLM all'avanguardia mostra un grave collasso dell'aderenza alle istruzioni.
  • L'elevata soddisfazione per vincolo maschera una bassa conformità olistica.
  • Esistono barriere profonde sotto lacune di conoscenza e conflitti fattuali anche con inferenza potenziata dal ragionamento.
  • L'articolo è disponibile su arXiv con ID 2608.11584.
  • Il benchmark mira a catturare le condizioni di produzione in cui documenti rumorosi e vincoli multidimensionali coesistono.

Entità

Istituzioni

  • arXiv

Fonti