पहला RAG डेमो हमेशा काम करता है।
आप साफ-सुथरा PDF अपलोड करते हैं। आप स्पष्ट प्रश्न पूछते हैं। मॉडल स्पष्ट पैराग्राफ ढूंढता है और एक अच्छी तरह से फंडेड सलाहकार के लहजे में उत्तर देता है।
फिर कोई उपयोगकर्ता गलत संक्षिप्त नाम के साथ प्रश्न पूछता है, नीति तीन हफ्ते पहले बदल गई थी, उत्तर दो दस्तावेज़ों में बिखरा हुआ है, और सिस्टम एक ऐसे पैराग्राफ का हवाला देता है जो संबंधित लगता है लेकिन वास्तव में दावे का समर्थन नहीं करता।
तब उत्पाद शुरू होता है।
पुनर्प्राप्ति पहला उत्पाद निर्णय है
RAG गुणवत्ता मॉडल के कुछ भी देखने से पहले शुरू होती है।
पुनर्प्राप्ति परत तय करती है कि मॉडल को क्या जानने की अनुमति है। यदि गलत चंक वापस आते हैं, तो उत्तर पहले से ही समझौता हो चुका है। एक बेहतर प्रॉम्प्ट समस्या को छिपा सकता है। यह इसे ठीक नहीं करेगा।
मैं पुनर्प्राप्ति का मूल्यांकन सामान्य प्रश्नों से करता हूँ:
- क्या सही दस्तावेज़ शीर्ष परिणामों में दिखाई दिया?
- क्या सही अनुभाग दिखाई दिया, न कि केवल सही फ़ाइल?
- क्या नई सामग्री पुरानी सामग्री से आगे निकल गई?
- क्या क्वेरी उस तरह से काम करती है जैसे कोई वास्तविक उपयोगकर्ता इसे तैयार करेगा?
- क्या सिस्टम ने कुछ नहीं लौटाया जब ईमानदार उत्तर कुछ नहीं था?
वह अंतिम बिंदु मायने रखता है। एक खोज प्रणाली जो हमेशा कुछ लौटाती है, मॉडल को हमेशा कुछ कहना सिखाती है।
उद्धरण निष्ठा उत्तर आत्मविश्वास से अधिक महत्वपूर्ण है
उत्तर पर्याप्त नहीं है।
किसी भी ज्ञान प्रणाली के लिए, मैं जानना चाहता हूँ कि क्या उद्धृत स्रोत वास्तव में उस वाक्य का समर्थन करता है जिसका दावा किया जा रहा है।
इसका मतलब है दावे के स्तर पर मूल्यांकन करना, न कि केवल प्रतिक्रिया स्तर पर। यदि उत्तर में चार दावे हैं और केवल दो समर्थित हैं, तो उत्तर "अधिकतर सही" नहीं है। यह एक ऐसे तरीके से खतरनाक है जो पॉलिश दिखता है।
एक सरल रूब्रिक काम करता है:
- समर्थित: उद्धरण सीधे दावे को साबित करता है।
- आंशिक: उद्धरण संबंधित है लेकिन पूरी तरह से साबित नहीं करता।
- असमर्थित: उद्धरण दावे को साबित नहीं करता।
- विरोधाभासी: उद्धरण विपरीत कहता है।
आपको शुरू करने के लिए एक विस्तृत बेंचमार्क की आवश्यकता नहीं है। आपको 30 वास्तविक प्रश्न और ईमानदारी से चूक को चिह्नित करने का अनुशासन चाहिए।
इनकार एक विशेषता है
RAG सिस्टम को पता होना चाहिए कि कब उत्तर नहीं देना है।
इसका मतलब है उन प्रश्नों का परीक्षण करना जहां कॉर्पस में उत्तर नहीं है। इसका मतलब उन प्रश्नों का परीक्षण करना भी है जहां उत्तर संवेदनशील, पुराना है, या उस संदर्भ पर निर्भर करता है जो उपयोगकर्ता ने प्रदान नहीं किया।
अच्छा इनकार व्यवहार ऐसा लगता है:
"मुझे उपलब्ध स्रोतों में वह नहीं दिखता। सबसे करीबी संबंधित दस्तावेज़ X है, लेकिन यह सीधे प्रश्न का उत्तर नहीं देता।"
बुरा इनकार व्यवहार ऐसा लगता है:
"उपलब्ध जानकारी के आधार पर, ऐसा प्रतीत होता है..."
वह वाक्यांश वह जगह है जहां भ्रम एक ब्लेज़र पहन लेता है।
उपयोगी स्कोरकार्ड
एक आंतरिक RAG सिस्टम के लिए, मैं एक प्रभावशाली बेंचमार्क स्कोर की तुलना में पांच आधारभूत मीट्रिक ट्रैक करना पसंद करूंगा:
- पुनर्प्राप्ति हिट दर: क्या सही स्रोत दिखाई दिया?
- उद्धरण निष्ठा: क्या स्रोत ने उत्तर का समर्थन किया?
- इनकार सटीकता: क्या इसने असमर्थित प्रश्नों को अस्वीकार किया?
- उत्तर उपयोगिता: क्या उपयोगकर्ता अगला कदम उठा सकता है?
- संपादन दूरी: मानव को कितना बदलना पड़ा?
अंतिम मीट्रिक सबसे ईमानदार है। यदि उपयोगकर्ता उत्तर को फिर से लिखते रहते हैं, तो सिस्टम उनका समय नहीं बचा रहा है। यह एक विनम्र पहला ड्राफ्ट बना रहा है जिसकी उन्हें निगरानी करनी है।
मापने के लिए पर्याप्त छोटा शुरू करें
सही पहला RAG सिस्टम आमतौर पर "कंपनी का दिमाग" नहीं होता।
यह एक कॉर्पस, एक वर्कफ़्लो, एक उपयोगकर्ता प्रकार और उत्तर के बाद एक स्पष्ट कार्रवाई है। सहायता मैक्रोज़। बिक्री सक्षमीकरण। नीति लुकअप। आंतरिक इंजीनियरिंग दस्तावेज़। अनुबंध खंड खोज।
संकीर्ण दायरा मूल्यांकन को संभव बनाता है।
मूल्यांकन विश्वास को संभव बनाता है।
विश्वास विस्तार को संभव बनाता है।
वह क्रम मायने रखता है।
