هل الـ RAG عندك شغال فعلاً؟ تقييم أنظمة الـ AI في الإنتاج
دليل تقني لقياس جودة أنظمة الـ AI. ابنِ test set، قيّم الـ retrieval والأجوبة، استخدم confidence scoring، وسكّر الحلقة بمراجعة بشرية.
السؤال اللي ما تقدر تجاوب عليه
خليني أكون مباشر: أغلب الفرق اللي مشغّلة نظام RAG أو AI agent في الإنتاج ما تقدر تجاوب على سؤال بسيط. هل هو منيح؟ عندهم demo بهرت حدا، كم مثال منتقى بعناية، وإحساس غامض إنو المستخدمين مبسوطين. هاد مش تقييم، هاد أمل. والأمل ما بيقلك إذا تغيير الأسبوع الماضي حسّن الأمور أو خرّبها بصمت.
تقييم الـ AI أصعب من تقييم السوفتوير التقليدي لأنو نادراً ما يكون في ناتج واحد صحيح. الـ retrieval ممكن يكون صح جزئياً، الجواب ممكن يكون مقنع بس غلط، ونفس المدخل ممكن يطلع نواتج مختلفة. بس أصعب ما معناها مستحيل. بتقيس جودة الـ AI بنفس الطريقة اللي بتقيس فيها أي شي ما بتقدر تحكم عليه بالعين: ابنِ test set، عرّف مقاييس، قيّم مقابلها، وراقب الأرقام مع الوقت. هاد الدليل بيوريك كيف.
إذا ما بتقدر تقول إذا الـ AI عندك صار أحسن أو أسوأ بعد تغيير، أنت مش مشغّل نظام، أنت عم تتأمل خير منه. التقييم هو اللي بيحوّل الأمل لهندسة.
نحنا منبني AI قابل للقياس، ومنشغّل confidence scoring وحلقة مراجعة بمنصتنا Exfinity. هاد الدليل هو هالانضباط نفسه. لهندسة الـ retrieval نفسها، شوف دليل أنظمة RAG للمؤسسات، وهاد شغل أساسي من خدمات الـ AI عنا.
مين بيهمو شو
| الدور | السؤال الحقيقي | شو شكل "المنيح" |
|---|---|---|
| مهندس AI | تغييري ساعد أو ضرّ؟ | test set ورقم، مش إحساس |
| قائد المنتج | الجودة بتكفي للإطلاق؟ | معيار جودة، مقاس |
| CTO | فينا نمسك الـ regressions؟ | بوابة بتفشل لما تنزل الجودة |
| الدعم / العمليات | أي أجوبة مش موثوقة؟ | الثقة المنخفضة معلّمة للمراجعة |
| قائد البيانات | النظام عم يتحسن مع الوقت؟ | اتجاه، مش لقطة |
نوعين من التقييم
في وضعين، وأنت محتاج التنين.
التقييم الـ offline بيمشي على test set ثابت، قبل ما تطلق. عندك أسئلة معروفة وأجوبة منيحة معروفة، وبتقيّم النظام مقابلها. هاي بوابة الـ regression تبعتك: بتقلك إذا التغيير ساعد أو ضرّ قبل ما يحس فيه المستخدمين الحقيقيين.
التقييم الـ online بيمشي على الترافيك الحي، بعد ما تطلق. المستخدمين الحقيقيين بيسألوا أشياء غير متوقعة، وبتقيس أداء النظام على أرض الواقع عبر confidence scores والملاحظات والنتائج. هاد بيمسك اللي الـ test set ما توقعو.
| الوضع | إيمتى | بيجاوب على |
|---|---|---|
| Offline | قبل الإطلاق | هاد التغيير ساعد أو ضرّ؟ |
| Online | في الإنتاج | كيف أداؤه على مدخلات حقيقية وغير متوقعة؟ |
الغلط إنك تعمل واحد بس. الـ offline لحالو بيفوّت اللي المستخدمين الحقيقيين فعلاً بيسألوه. الـ online لحالو معناها بتلاقي الـ regressions بعد ما توصل للعملاء. دليل مراقبة أنظمة الـ AI عنا بيغطي الجانب الـ online بالتفصيل.
ابنِ الـ test set أول شي
كل شي بيبدأ بـ test set: أسئلة ممثلة للواقع مربوطة بشكل الجواب المنيح. هاد أعلى شي من ناحية التأثير فيك تبنيه، لأنو بدونه كل تقييم بيصير ذوق شخصي.
الـ test set المنيح مش مية سؤال سهل. هو خلطة مقصودة.
- الحالات الشائعة. الأسئلة اللي المستخدمين فعلاً بيسألوها أكتر شي.
- الحالات الصعبة. أسئلة غامضة أو متعددة الأجزاء أو حدّية، اللي غالباً النظام بيغلط فيها.
- الأخطاء المعروفة. كل bug لقيته بحياتك، مضاف كفحص regression دائم.
- الحالات العدائية. أسئلة مصممة تحرّض على الهلوسة أو تسريب البيانات.
خليه تحت version control، كبّرو كل ما تلاقي فشل جديد، وشغّلو مع كل تغيير. هاد بيحوّل "بحس إنو أحسن" لـ "الـ recall طلع نقطتين وما في شي رجع لورا". دليل من النموذج الأولي للإنتاج عنا بيغطي بناء هاد الشي من البداية.
قيس الـ retrieval والتوليد كل واحد لحالو
جواب الـ RAG ممكن يكون سيء لسببين مختلفين تماماً: الـ retrieval جاب مستندات غلط، أو الـ retrieval كان تمام والموديل كتب جواب سيء من مستندات منيحة. إذا بتقيس الجواب النهائي بس، ما بتقدر تعرف أي واحد فيهن، وما فيك تصلّح شي ما فيك تحدد مكانه.
قيس المرحلتين كل وحدة لحالها.
| المرحلة | المقياس | بيسأل |
|---|---|---|
| Retrieval | Recall at k | المستندات الصح موجودة بأول k نتيجة؟ |
| Retrieval | ترتيب أول نتيجة ذات صلة | النتيجة الصح قريبة من القمة؟ |
| التوليد | Faithfulness | الجواب ملتزم بالحقائق اللي انجابت؟ |
| التوليد | صلة الجواب | فعلاً بيجاوب على السؤال؟ |
| من أول لآخر | Attribution | الموديل استخدم السياق اللي انجاب؟ |
لما الجودة تنزل، هاد الفصل بيقلك وين تدوّر. مقاييس الـ retrieval نازلة معناها صلّح الـ chunking أو الـ embeddings أو البحث الهجين، وهاد مغطى في دليل هندسة البحث المتجهي. مقاييس التوليد نازلة مع retrieval منيح معناها صلّح الـ prompt أو الموديل. دليل موثوقية RAG في الإنتاج عنا بيغطي أنماط الفشل.
مثال عملي: مدخل واحد من الـ test set
خلي التقييم ملموس بحالة اختبار وحدة، لأنو كل هالانضباط مبني من هدول.
مدخل الـ test set هو سؤال، والمستندات اللي المفروض تنجاب، وشو لازم يحتوي الجواب المنيح.
Question: "What is the cancellation policy for same-day tours?"
Should retrieve: policy-doc-cancellations (chunk 3)
Good answer: states same-day tours are non-refundable, cites the policy
هلق شغّل تغيير، خلينا نقول استراتيجية chunking جديدة، وقيّم النظام مقابله.
Retrieval: was the right chunk in the top k? yes -> recall ok
Rank: where did it land? rank 1 -> good
Faithfulness: did the answer stick to the chunk? yes -> no invention
Relevance: did it actually answer the question? yes
Attribution: did it cite the source? yes
حالة خضرا وحدة ما بتثبت شي. مية متلها، بتغطي الأسئلة الشائعة والصعبة وكل bug قديم والمحاولات العدائية، بتعطيك رقم: هاد التغيير رفع recall الـ retrieval نقطتين وما رجّع شي لورا، أو كسر بصمت حالة جولة نفس اليوم اللي كانت تنجح قبل. هاد الفرق بين "حاسس إنو أحسن" و"هي شو تغير". كل bug بتلاقيه بيصير مدخل دائم هون، حتى نفس الغلطة ما ترجع بدون ما حدا ينتبه. دليل أنظمة RAG للمؤسسات عنا بيغطي ضبط الـ retrieval اللي هالمقاييس بتقيسه.
Confidence scoring: تقييم شغال live
المقاييس الـ offline بدها أجوبة معروفة. في الإنتاج ما عندك ياها، فمحتاج إشارة النظام يقدر يحسبها على كل رد بدون ground truth. هالإشارة هي confidence score.
الـ confidence score العملي هو تركيبة من عوامل فيك تقيسها وقت التشغيل. في Exfinity، كل رد بينقيّم على أربعة: إذا الـ retrieval رجّع نتائج مفيدة، إذا الرد عدّى فحوصات الـ policy، إذا هو جوهري مش مجرد رد ناقص، وإذا كان في عمق محادثة كافي يرتكز عليه.
confidence = retrieval * 0.4 // هل رجّعت الأدوات نتائج مفيدة
+ policy * 0.2 // أي تحذيرات تحقق
+ completeness * 0.2 // جواب فعلي مش مجرد رد ناقص
+ memory * 0.2 // سياق كافي حتى يكون الجواب مرتكز
الرد اللي تحت العتبة بينعلّم كـ low confidence وبينوجّه لمراجعة بشرية قبل ما ننثق فيه، والنظام بيصنف ليش كان منخفض: retrieval فاشل، حظر policy، إشارة هلوسة متل تاريخ قديم منعرض كأنو حالي. هاد بيعطيك إشارة جودة حية على كل رد، مش بس على الـ test set. هاد تقييم شغال في الإنتاج، باستمرار.
سكّر الحلقة: مراجعة بتحسّن النظام
الـ confidence score اللي بس بيعلّم المشاكل هو لمبة تحذير. الـ confidence score الموصول بحلقة مراجعة هو نظام بيتحسن.
لما الرد يكون low confidence، إنسان بيراجعه. إذا الجواب كان لازم يكون منيح، الجواب الموافق عليه بينرجع لقاعدة المعرفة، حتى نفس السؤال يجيب جواب منيح المرة الجاية. في Exfinity، حلقة التعلم الذاتي هاي بتظبط حتى عتبتها بنفسها: إذا المراجعين عم يوافقوا تقريباً على كل شي منعلّم، العتبة بتنزل حتى تمسك أكتر؛ وإذا عم يرفضوا كتير، بتطلع حتى تقلل الضجيج. النظام بيصير أحسن بشكل قابل للقياس من استخدامه، بدل ما بس يتراكم. هاد نمط human in the loop مطبق على الجودة نفسها، وبيتوصل مع أنماط الذاكرة في دليل ذاكرة الوكلاء عنا.
خليها بوابة، مش تقرير
التقييم اللي بيطلع تقرير ما حدا بيقراه ما بيغير شي. التقييم اللي بيوقف deploy بيغير كل شي. وصّل الـ test set الـ offline تبعك بالـ pipeline حتى أي تغيير بينزّل الجودة تحت المعيار يفشّل البناء، بنفس الطريقة اللي unit test فاشل بيعملها.
هاد التحول من "منقيّم أحياناً" لـ "ما فينا نطلق regression". هاي الممارسة الوحيدة اللي أكتر شي بتفرق بين الفرق اللي جودة الـ AI عندها عم تتحسن والفرق اللي جودتها عم تنجرف. دليل مراقبة أنظمة الـ AI عنا بيغطي وصل المقاييس الـ online بالتنبيهات بنفس الطريقة.
كيف تبدأ
- ابنِ test set. حالات شائعة وصعبة وأخطاء معروفة وحالات عدائية. حط عليه versioning.
- افصل المقاييس. قيس الـ retrieval والتوليد كل واحد لحالو حتى تعرف وين تدوّر.
- ضيف confidence score. إشارة حية على كل رد، مع عتبة مراجعة.
- سكّر الحلقة. وجّه الثقة المنخفضة لمراجعة بشرية، ورجّع الأجوبة المنيحة لقاعدة المعرفة.
- حط بوابة على الـ deploy. فشّل البناء عند regression بالجودة، مش بس عند اختبار مكسور.
هاد الشي بيمشي على مراحل وبيناسب منهجيتنا. فرق السوفتوير المخصص والاستشارات عنا بتبني AI قابل للقياس. ابدأ من تواصل معنا أو خد عرض سعر محدد النطاق.
الطرق الشائعة اللي بتخرب فيها القصة
- ما في test set. كل تقييم بيصير شخصي. ابنِ واحد وحط عليه versioning.
- قياس الجواب النهائي بس. ما بتقدر تعرف إذا الـ retrieval أو التوليد اللي فشل. افصلهن.
- Offline أو online بس. الـ offline بيفوّت الأسئلة الحقيقية، والـ online بيلاقي الـ regressions متأخر. اعمل التنين.
- Confidence score بدون حلقة. التعليم بدون تصليح ما بيغير شي. وجّه للمراجعة، ورجّع الأجوبة.
- تقرير ما حدا بيقراه. حط بوابة جودة على الـ deploy، حتى الـ regression ما يقدر يطلع.
مين بيبني هاد الشي
Oronts شركة سوفتوير بقيادة مؤسسها في ميونخ. Refaat Al Ktifan، مؤسسنا ومهندس الحلول عنا، بيقود فريق senior بيبني AI فيك تقيسه. منصتنا Exfinity بتقيّم كل رد، بتوجّه الثقة المنخفضة للمراجعة، وبتتحسن من الحلقة. منبني الـ test set والمقاييس والـ confidence scoring وحلقة المراجعة، ومنسلمك نظام فيك فعلاً تشوف جودته وتدافع عنها. شوف صفحات الخدمات والحلول عنا.
الخلاصة
- إذا ما فيك تقول إذا الـ AI عندك صار أحسن أو أسوأ بعد تغيير، أنت عم تتأمل، مش عم تهندس.
- ابنِ test set عليه versioning من حالات شائعة وصعبة وأخطاء معروفة وحالات عدائية.
- قيس الـ retrieval والتوليد كل واحد لحالو حتى تعرف أي واحد تصلّح.
- ضيف confidence score حي مع عتبة مراجعة، وسكّر الحلقة حتى النظام يتحسن.
- حط بوابة جودة على الـ deploy حتى الـ regression ما يقدر يطلع.
التقييم مش مرحلة بتعملها مرة وحدة. هو لوحة العدادات اللي بتطير فيها النظام. ابنيه بكير، حط البوابة عليه دايماً، والـ AI عندك بيتحسن بدل ما ينجرف.
مش متأكد إذا الـ AI عندك شغال فعلاً؟ خبرنا شو عم تشغّل. ابدأ من تواصل معنا أو خد عرض سعر محدد النطاق.
المواضيع المغطاة
أدلة ذات صلة
ذاكرة وكيل بتتذكر فعلاً: الـ knowledge graphs وتجميع السياق
دليل تقني معمّق لذاكرة الوكلاء في الإنتاج: النوافذ الحديثة، الاستدعاء الدلالي، قوالب الـ working memory، الـ knowledge graphs لكل tenant، وتجميع السياق على طبقات.
اقرأ الدليلالدليل الشامل لأنظمة الذكاء الاصطناعي الوكيلي
دليل تقني لأنظمة الذكاء الاصطناعي الوكيلي في بيئات الأعمال. تعرف على البنية والقدرات والتطبيقات العملية للوكلاء المستقلين.
اقرأ الدليلالتجارة الوكيلية: كيف تخلي وكلاء الذكاء الاصطناعي يشترون بأمان
كيف تصمم تجارة وكيلية محكومة. محركات السياسات، بوابات الموافقة البشرية، إيصالات HMAC، الـ idempotency، عزل المستأجرين، وبروتوكول الدفع الوكيلي الكامل.
اقرأ الدليلهل تبني شيئاً مماثلاً؟
نصمم ونشغّل أنظمة إنتاجية كالنظام الوارد في هذا الدليل. تحدّث إلى المهندسين الذين كتبوه، دون أي عرض مبيعات.
ابدأ محادثة