الرعب الأكبر لكل مطور ذكاء اصطناعي#
قمت بتعديل بسيط في الـ Prompt لتحسين الأسلوب، فإذا بالتطبيق يبدأ في اختراع أسعار منتجات لا وجود لها! كيف تعرف أن تعديلك اليوم لم يدمر 20% من الحالات التي كانت تعمل بنجاح أمس؟
المقاييس الثلاثة الذهبية في Ragas و DeepEval#
- Faithfulness (الأمانة للمصدر): هل كل ادعاء في الإجابة مدعوم بحقيقة موجودة في سياق البحث؟
- Answer Relevancy (صلة الإجابة): هل أجاب النموذج مباشرة عن سؤال المستخدم دون حشو غير مطلوب؟
- Context Recall (كفاية الاسترجاع): هل محرك البحث الداخلي جلب كل المقاطع الضرورية لصياغة إجابة كاملة؟
المهنة الجديدة: مهندس تقييم واختبار الذكاء الاصطناعي (LLM Evaluation Engineer)#
تعتبر هذه الوظيفة اليوم المعادل الحديث لمهندس ضمان الجودة (QA) مع رواتب تتجاوز 100 ألف دولار سنوياً في الأسواق العالمية لتأمين موثوقية المنتجات.
