المدونة

مقالات عربية عملية تشرح الذكاء الاصطناعي بعمق ووضوح: من طريقة تفكير النماذج، إلى بناء الوكلاء، وإعداد البيانات، وحوكمة الأنظمة، وفرص العمل في المجال.

4 نتيجة للبحث عن «التقييم» · مسح البحث

هندسة الأوامر

كيف تقيس جودة تطبيق ذكاء اصطناعي؟ دليل بناء مجموعة تقييم (Evals) قبل أن يكتشف العميل الخطأ

«جرّبته وكان ممتازًا» ليس قياسًا. كل تعديل في التعليمات أو تغيير في النموذج قد يُصلح حالة ويكسر عشرًا دون أن تشعر. دليل عملي لبناء مجموعة تقييم على مثال مساعد دعم فني لشركة إنترنت منزلي: الحالات الذهبية، والفحوص الآلية، والنموذج الحَكَم بمعيار مكتوب، والمراجعة البشرية، واختبار الانحدار، وأخطاء الحَكَم التي تخدعك.7 دقائق قراءة
الوكلاء والأتمتة

بناء مساعد معرفي لشركة بتقنية RAG: من ملفات السياسات والكتيّبات إلى إجابات موثوقة بمصادرها

النموذج اللغوي لا يعرف سياسة الاسترجاع في متجرك ولا مواصفات منتجاتك، وإن سألته اخترع إجابة مقنعة. التوليد المعزّز بالاسترجاع (RAG) يحلّ ذلك: يبحث في مستنداتك أولًا ثم يجيب منها ويذكر مصدره. دليل عملي كامل على مثال متجر إلكترونيات: تجهيز المستندات، والتقطيع، والتضمين، والاسترجاع، وتعليمات الإجابة، والتقييم، وأشهر الأعطال وعلاجها.7 دقائق قراءة
البرمجة بالوصف

مشروع كامل في Cursor: سبع تذاكر عملاء، وسبع قواعد، ومعيار تقييم من مئة

من رسالة عميل غامضة إلى صفحة HTML تعمل وتُسلَّم باحتراف، كلها داخل Cursor. سبع قواعد تسليم، وروتين تنفيذ من ثماني خطوات، وسبعة مشاريع في مجالات مختلفة لكل منها فخّ مدفون في كلام العميل، ثم معيار التقييم الكامل.19 دقائق قراءة
حوكمة الذكاء الاصطناعي

إطار NIST لإدارة مخاطر الذكاء الاصطناعي بعين المختبِر: سبع سمات للثقة، وسبع جبهات للاختبار

إطار NIST AI RMF ليس وثيقة حوكمة للقراءة فقط، بل قائمة قواعد: سبع سمات يجب أن يحقّقها النظام الجدير بالثقة، ومهمّة المختبِر أن يكشف أين تنهار كلٌّ منها. نترجم الإطار إلى خريطة فحص عملية: تعريف الخطر، ودوائر الضرر، والسمات السبع، وأنواع التحيّز، والوظائف الأربع، وحقول سجل الاختبار، وسلّم التقييم، وربط كل سمة بأداة.10 دقائق قراءة