أول عرض توضيحي لـ RAG ينجح دائمًا.
ترفع ملف PDF نظيفًا. تطرح السؤال الواضح. يجد النموذج الفقرة الواضحة ويجيب بنبرة مستشار ممول جيدًا.
ثم يطرح مستخدم سؤالًا باستخدام اختصار خاطئ، وتتغير السياسة قبل ثلاثة أسابيع، ويكون الجواب موزعًا على مستندين، ويقتبس النظام فقرة تبدو ذات صلة ولكنها لا تدعم الادعاء فعليًا.
هنا يبدأ المنتج الحقيقي.
الاسترجاع هو أول قرار منتج
جودة RAG تبدأ قبل أن يرى النموذج أي شيء.
طبقة الاسترجاع هي التي تقرر ما يُسمح للنموذج بمعرفته. إذا عادت القطع الخاطئة، يكون الجواب معرضًا للخطر بالفعل. قد يخفي تحسين الموجه المشكلة، لكنه لن يحلها.
أقيّم الاسترجاع بأسئلة بسيطة:
- هل ظهر المستند الصحيح في النتائج العليا؟
- هل ظهر القسم الصحيح، وليس فقط الملف الصحيح؟
- هل تفوقت المواد الأحدث على المواد الأقدم؟
- هل نجح الاستعلام عندما صيغ كما يصيغه مستخدم حقيقي؟
- هل أعاد النظام لا شيء عندما كان لا شيء هو الجواب الصادق؟
هذا السؤال الأخير مهم. نظام بحث يعيد دائمًا شيئًا ما يُعلّم النموذج أن يقول دائمًا شيئًا.
دقة الاقتباس تتفوق على ثقة الإجابة
الجواب وحده لا يكفي.
لأي نظام معرفي، أريد معرفة ما إذا كان المصدر المُقتبَس يدعم فعليًا الجملة التي يُدّعى أنها مدعومة به.
هذا يعني التقييم على مستوى الادعاء، وليس فقط على مستوى الاستجابة. إذا كان الجواب يحتوي على أربعة ادعاءات واثنان فقط مدعومان، فالجواب ليس "صحيحًا في الغالب." إنه خطير بطريقة تبدو مصقولة.
مقياس بسيط يعمل:
- مدعوم: الاقتباس يثبت الادعاء مباشرة.
- جزئي: الاقتباس ذو صلة لكنه لا يثبت الادعاء بالكامل.
- غير مدعوم: الاقتباس لا يثبت الادعاء.
- متناقض: الاقتباس يقول العكس.
لا تحتاج إلى معيار معقد للبدء. تحتاج إلى 30 سؤالًا حقيقيًا والانضباط لتسجيل الأخطاء بأمانة.
الرفض ميزة
أنظمة RAG تحتاج إلى معرفة متى لا تجيب.
هذا يعني اختبار أسئلة لا يحتوي المرجع فيها على الإجابة. ويعني أيضًا اختبار أسئلة تكون الإجابة فيها حساسة، أو قديمة، أو تعتمد على سياق لم يقدمه المستخدم.
سلوك الرفض الجيد يبدو كالتالي:
"لا أرى ذلك في المصادر المتاحة. أقرب مستند ذي صلة هو X، لكنه لا يجيب على السؤال مباشرة."
سلوك الرفض السيئ يبدو كالتالي:
"بناءً على المعلومات المتاحة، يبدو أن..."
هذه العبارة هي حيث ترتدي الهلوسة بذلة رسمية.
بطاقة الأداء المفيدة
لنظام RAG داخلي، أفضل تتبع خمسة مقاييس قائمة على الأرض بدلاً من درجة معيارية واحدة مبهرة:
- معدل نجاح الاسترجاع: هل ظهر المصدر الصحيح؟
- دقة الاقتباس: هل دعم المصدر الإجابة؟
- دقة الرفض: هل رفض الأسئلة غير المدعومة؟
- فائدة الإجابة: هل يمكن للمستخدم اتخاذ الخطوة التالية؟
- مسافة التحرير: كم احتاج الإنسان إلى التغيير؟
المقياس الأخير هو الأكثر صدقًا. إذا استمر المستخدمون في إعادة كتابة الإجابة، فإن النظام لا يوفر لهم الوقت. إنه يخلق مسودة أولى مهذبة يجب عليهم الإشراف عليها.
ابدأ صغيرًا بما يكفي للقياس
أول نظام RAG صحيح عادةً ليس "عقل الشركة."
إنه مرجع واحد، سير عمل واحد، نوع مستخدم واحد، وإجراء واحد واضح بعد الإجابة. وحدات ماكرو للدعم. تمكين المبيعات. البحث في السياسات. وثائق الهندسة الداخلية. البحث في بنود العقود.
النطاق الضيق يجعل التقييم ممكنًا.
التقييم يجعل الثقة ممكنة.
الثقة تجعل التوسع ممكنًا.
هذا الترتيب مهم.
