Skip to main content
AI10 min read

बेंचमार्क थिएटर के बिना RAG मूल्यांकन

पुनर्प्राप्ति-वर्धित पीढ़ी का मूल्यांकन करने का एक आधारभूत तरीका: स्रोत कवरेज, उद्धरण निष्ठा, अस्वीकार व्यवहार, और कार्य-स्तरीय उपयोगिता।

Part ofAI Engineering->
By Jason TeixeiraJune 16, 2026
RAGAI EvaluationSearchLLMsKnowledge Systems
Share:
On this page

पहला RAG डेमो हमेशा काम करता है।

आप साफ-सुथरा PDF अपलोड करते हैं। आप स्पष्ट प्रश्न पूछते हैं। मॉडल स्पष्ट पैराग्राफ ढूंढता है और एक अच्छी तरह से फंडेड सलाहकार के लहजे में उत्तर देता है।

फिर कोई उपयोगकर्ता गलत संक्षिप्त नाम के साथ प्रश्न पूछता है, नीति तीन हफ्ते पहले बदल गई थी, उत्तर दो दस्तावेज़ों में बिखरा हुआ है, और सिस्टम एक ऐसे पैराग्राफ का हवाला देता है जो संबंधित लगता है लेकिन वास्तव में दावे का समर्थन नहीं करता।

तब उत्पाद शुरू होता है।

पुनर्प्राप्ति पहला उत्पाद निर्णय है

RAG गुणवत्ता मॉडल के कुछ भी देखने से पहले शुरू होती है।

पुनर्प्राप्ति परत तय करती है कि मॉडल को क्या जानने की अनुमति है। यदि गलत चंक वापस आते हैं, तो उत्तर पहले से ही समझौता हो चुका है। एक बेहतर प्रॉम्प्ट समस्या को छिपा सकता है। यह इसे ठीक नहीं करेगा।

मैं पुनर्प्राप्ति का मूल्यांकन सामान्य प्रश्नों से करता हूँ:

  • क्या सही दस्तावेज़ शीर्ष परिणामों में दिखाई दिया?
  • क्या सही अनुभाग दिखाई दिया, न कि केवल सही फ़ाइल?
  • क्या नई सामग्री पुरानी सामग्री से आगे निकल गई?
  • क्या क्वेरी उस तरह से काम करती है जैसे कोई वास्तविक उपयोगकर्ता इसे तैयार करेगा?
  • क्या सिस्टम ने कुछ नहीं लौटाया जब ईमानदार उत्तर कुछ नहीं था?

वह अंतिम बिंदु मायने रखता है। एक खोज प्रणाली जो हमेशा कुछ लौटाती है, मॉडल को हमेशा कुछ कहना सिखाती है।

उद्धरण निष्ठा उत्तर आत्मविश्वास से अधिक महत्वपूर्ण है

उत्तर पर्याप्त नहीं है।

किसी भी ज्ञान प्रणाली के लिए, मैं जानना चाहता हूँ कि क्या उद्धृत स्रोत वास्तव में उस वाक्य का समर्थन करता है जिसका दावा किया जा रहा है।

इसका मतलब है दावे के स्तर पर मूल्यांकन करना, न कि केवल प्रतिक्रिया स्तर पर। यदि उत्तर में चार दावे हैं और केवल दो समर्थित हैं, तो उत्तर "अधिकतर सही" नहीं है। यह एक ऐसे तरीके से खतरनाक है जो पॉलिश दिखता है।

एक सरल रूब्रिक काम करता है:

  • समर्थित: उद्धरण सीधे दावे को साबित करता है।
  • आंशिक: उद्धरण संबंधित है लेकिन पूरी तरह से साबित नहीं करता।
  • असमर्थित: उद्धरण दावे को साबित नहीं करता।
  • विरोधाभासी: उद्धरण विपरीत कहता है।

आपको शुरू करने के लिए एक विस्तृत बेंचमार्क की आवश्यकता नहीं है। आपको 30 वास्तविक प्रश्न और ईमानदारी से चूक को चिह्नित करने का अनुशासन चाहिए।

इनकार एक विशेषता है

RAG सिस्टम को पता होना चाहिए कि कब उत्तर नहीं देना है।

इसका मतलब है उन प्रश्नों का परीक्षण करना जहां कॉर्पस में उत्तर नहीं है। इसका मतलब उन प्रश्नों का परीक्षण करना भी है जहां उत्तर संवेदनशील, पुराना है, या उस संदर्भ पर निर्भर करता है जो उपयोगकर्ता ने प्रदान नहीं किया।

अच्छा इनकार व्यवहार ऐसा लगता है:

"मुझे उपलब्ध स्रोतों में वह नहीं दिखता। सबसे करीबी संबंधित दस्तावेज़ X है, लेकिन यह सीधे प्रश्न का उत्तर नहीं देता।"

बुरा इनकार व्यवहार ऐसा लगता है:

"उपलब्ध जानकारी के आधार पर, ऐसा प्रतीत होता है..."

वह वाक्यांश वह जगह है जहां भ्रम एक ब्लेज़र पहन लेता है।

उपयोगी स्कोरकार्ड

एक आंतरिक RAG सिस्टम के लिए, मैं एक प्रभावशाली बेंचमार्क स्कोर की तुलना में पांच आधारभूत मीट्रिक ट्रैक करना पसंद करूंगा:

  1. पुनर्प्राप्ति हिट दर: क्या सही स्रोत दिखाई दिया?
  2. उद्धरण निष्ठा: क्या स्रोत ने उत्तर का समर्थन किया?
  3. इनकार सटीकता: क्या इसने असमर्थित प्रश्नों को अस्वीकार किया?
  4. उत्तर उपयोगिता: क्या उपयोगकर्ता अगला कदम उठा सकता है?
  5. संपादन दूरी: मानव को कितना बदलना पड़ा?

अंतिम मीट्रिक सबसे ईमानदार है। यदि उपयोगकर्ता उत्तर को फिर से लिखते रहते हैं, तो सिस्टम उनका समय नहीं बचा रहा है। यह एक विनम्र पहला ड्राफ्ट बना रहा है जिसकी उन्हें निगरानी करनी है।

मापने के लिए पर्याप्त छोटा शुरू करें

सही पहला RAG सिस्टम आमतौर पर "कंपनी का दिमाग" नहीं होता।

यह एक कॉर्पस, एक वर्कफ़्लो, एक उपयोगकर्ता प्रकार और उत्तर के बाद एक स्पष्ट कार्रवाई है। सहायता मैक्रोज़। बिक्री सक्षमीकरण। नीति लुकअप। आंतरिक इंजीनियरिंग दस्तावेज़। अनुबंध खंड खोज।

संकीर्ण दायरा मूल्यांकन को संभव बनाता है।

मूल्यांकन विश्वास को संभव बनाता है।

विश्वास विस्तार को संभव बनाता है।

वह क्रम मायने रखता है।

Reader route

article -> proof -> offer

ReadClusterProofScope

cluster

AI Engineering

intent

AI

route

next step

What to do with this

Turn the note into a build path.

If this topic maps to a real business problem, keep reading the cluster, study the academy path, or route the work into a scoped engagement.

Jason Teixeira
Written by
Jason Teixeira
Founder, Sage Ideas Studio · Principal Engineer
livebuild 5d6c8652026-08-05 06:00Z
// solo studio// no analytics resold// every commit human-reviewed