الاختبار العدائي (Red Teaming) أن تفكّر كمهاجم حتى يكتشف المطوّر الثغرة قبل أن يستغلّها مهاجم حقيقي. وفي النماذج اللغوية صار مهنة قائمة بذاتها، ولها جانب لغوي وثقافي عميق يفتقر السوق فيه إلى الكفاءات العربية. هذا المقال خريطتك الأولى إلى المجال.
بنهاية المقال ستعرف#
- الجذور التاريخية للمفهوم من المجال العسكري إلى النماذج اللغوية.
- الفرق الدقيق بين السلامة والأمن والمحاذاة والمتانة.
- الأطر الحاكمة: NIST AI RMF، وقانون الذكاء الاصطناعي الأوروبي، وOWASP LLM Top 10، وMITRE ATLAS.
- عقلية المختبِر العدائي، وموقع المختبِر اللغوي العربي في سوق السلامة.
من الحرب الباردة إلى عصر النماذج اللغوية#
الستينيات: الجذور العسكرية
فرق «حمراء» تلعب دور الخصم أمام فرق «زرقاء» في تدريبات وألعاب حرب لاختبار جاهزية القرار.
التسعينيات: الأمن السيبراني
تبنّت الشركات المفهوم في صورة اختبار الاختراق: فرق تحاول اختراق الأنظمة بعقلية المهاجم لكشف الثغرات قبل استغلالها.
2016: حادثة Tay
روبوت المحادثة Tay من Microsoft تحوّل خلال ساعات على تويتر إلى مصدر خطاب مسيء بفعل هجمات مستخدمين منظّمة؛ إنذار مبكر بضرورة اختبار الأنظمة قبل نشرها.
2020: GPT-3 وتقييم النماذج التوليدية
بداية الموجة الحقيقية لتقييم قدرات النماذج الكبيرة، وأولى الأوراق المخصّصة لاختبار الأمان والتحيّز فيها.
2022: الانفجار الجماهيري
نشرت Anthropic دراسة منهجية واسعة لاختبار النماذج اللغوية عدائيًّا، ثم أُطلق ChatGPT وانتشرت محاولات «كسر الحماية» الشعبية؛ فتحوّل الاختبار العدائي من نشاط داخلي إلى ضرورة صناعية.
2023: شبكات المختبِرين الخارجيين
أسّست OpenAI شبكة Red Teaming Network لاستقطاب مختبِرين من تخصّصات متعدّدة، وصار نشر نتائج الاختبار جزءًا من بطاقات النماذج.
2024: ثغرات السياق الطويل والأطر الحكومية
كشفت ورقة Many-Shot Jailbreaking ثغرة بنيوية في النماذج طويلة السياق، وأصدر NIST ملف AI 600-1 الخاص بالذكاء الاصطناعي التوليدي، ودخل القانون الأوروبي حيّز النفاذ.
2025–2026: وظيفة قائمة بذاتها
تحديث OWASP LLM Top 10 لعام 2025، وسريان التزامات النماذج العامة في القانون الأوروبي، وتحوّل مختبِر النماذج إلى مسمّى وظيفي، مع فجوة واضحة في المختبِرين متعدّدي اللغات والثقافات.
الأركان الأربعة لتقييم النماذج#
أربعة محاور يخلط بينها كثيرون، ولكلٍّ منها منهجية اختبار وأدوات قياس مختلفة.
السلامة
حماية المستخدم من أضرار المخرَجات: محتوى عنيف، أو تحريض، أو تضليل طبي، أو تسهيل إيذاء النفس. مثال: نموذج يرفض إعطاء تعليمات خطرة حتى مع الصياغات الملتوية.
الأمن
حماية النظام نفسه من الاختراق: حقن التعليمات، وتسريب بيانات التدريب، وسرقة النموذج، وحقن أوامر خبيثة في مستندات RAG. مثال: منع أمر مدفون في ملف PDF يُترجمه النموذج من أن يُنفَّذ.
المحاذاة
مطابقة سلوك النموذج للقيم المقصودة: الصدق، وعدم الإيذاء، واحترام التنوّع، ورفض الاستغلال العاطفي. مثال: نموذج لا يتظاهر بمشاعر حقيقية ليستدرج المستخدم إلى علاقة وهمية.
المتانة
ثبات الأداء أمام المدخلات الشاذّة أو المعادية: أخطاء إملائية متعمّدة، ولهجات نادرة، ومدخلات طويلة جدًّا. مثال: الترجمة تظلّ دقيقة مع تشكيل غير معتاد أو لهجة مغاربية.
الأطر الحاكمة الأربعة#
الأطر
معيار أمريكي طوعي لإدارة مخاطر الذكاء الاصطناعي (الإصدار 1.0، يناير 2023)، ومعه ملف AI 600-1 للنماذج التوليدية (2024). يقوم على أربع وظائف: GOVERN وMAP وMEASURE وMANAGE، وسبع سمات للثقة. عمل المختبِر يقع أساسًا في وظيفة القياس. اقرأ دليل المختبِر إلى NIST AI RMF.
تشريع ملزم من الاتحاد الأوروبي (اللائحة 2024/1689)، يصنّف الأنظمة في أربع درجات مخاطر: غير مقبولة، وعالية، ومحدودة، ودنيا. ويفرض صراحةً الاختبار العدائي الموثَّق على نماذج الأغراض العامة ذات المخاطر النظامية (المادة 55). اقرأ دليل المختبِر إلى القانون الأوروبي.
قائمة مجتمعية بأخطر عشر ثغرات في تطبيقات النماذج اللغوية، وتشمل نسخة 2025 تحديات أنظمة RAG والوكلاء:
| الرمز | الثغرة |
|---|---|
| LLM01 | حقن التعليمات (Prompt Injection) |
| LLM02 | كشف المعلومات الحسّاسة |
| LLM03 | سلسلة الإمداد |
| LLM04 | تسميم البيانات والنموذج |
| LLM05 | المعالجة غير السليمة للمخرجات |
| LLM06 | الصلاحيات المفرطة للوكيل (Excessive Agency) |
| LLM07 | تسريب تعليمات النظام |
| LLM08 | نقاط ضعف المتّجهات والتضمينات |
| LLM09 | المعلومات المضلّلة |
| LLM10 | الاستهلاك غير المحدود |
مصفوفة تكتيكية لتصنيف الهجمات المعروفة على أنظمة الذكاء الاصطناعي، على نمط مصفوفة MITRE ATT&CK في الأمن السيبراني: من الاستطلاع والوصول الأولي إلى التنفيذ والأثر. تفيدك في توثيق كل هجوم بلغة يفهمها فريق الأمن.
عقلية المختبِر العدائي#
الاختبار العدائي ليس أدوات فحسب، بل طريقة تفكير. ستة نماذج ذهنية قبل أن تصمّم أول اختبار:
الرجل الفولاذي لا القشّي
ابنِ أقوى نسخة ممكنة من الهجوم، لا أضعفها. المختبِر السيّئ يجرّب صياغات سطحية ثم يعلن النموذج آمنًا؛ والمحترف يفكّر كمهاجم حقيقي بدوافع وموارد حقيقية.
نمذجة التهديد بتقمّص الأدوار
مَن المهاجم؟ وما دوافعه وموارده وهدفه؟ تخيّل شخصيات مختلفة: قرصان، وصحفي، وخصم سياسي، وطفل فضولي، وباحث أكاديمي.
الخط الفاصل بين البحث والإيذاء
المختبِر يكشف الثغرات ليصلحها المطوّر، لا ليستغلّها. التزم بالكشف المسؤول، ولا تنشر هجومًا قبل إصلاحه، وحافظ على سرّية النتائج وفق العقد، واختبر فقط ما أُذن لك باختباره.
التكتيك والتقنية والإجراء
توثيق مستعار من الأمن السيبراني: التكتيك هو الهدف العام، والتقنية هي الأسلوب، والإجراء هو التنفيذ القابل للإعادة خطوة خطوة.
انضباط التوثيق
هجوم لم يُوثَّق هجوم لم يحدث. كل حالة تحتاج: النموذج وإصداره، ونص الأمر، ودرجة الحرارة، والنتيجة المتوقّعة والفعلية، والخطورة، وشروط إعادة الإنتاج؛ وغالبًا بصيغة JSONL.
العين العربية
ميزتك التنافسية: ترى ما لا يراه فريق أجنبي. الثقافة الدينية، واللهجات، والحساسيات السياسية الإقليمية، والأسماء والأعلام والأحداث التاريخية. هذه البقعة العمياء تحديدًا هي ما تحتاجه شركات النماذج.
السوق والمنصّات#
الطلب على المختبِرين ومقيّمي النماذج الناطقين بالعربية قائم لدى منصّات تقييم البيانات وشبكات المختبِرين الخارجيين، وتتفاوت طبيعة العمل والأجر بحسب المنصّة والمشروع ومستوى الخبرة.
| المنصّة | طبيعة العمل | المستوى |
|---|---|---|
| Surge AI | تقييم وتدريب نماذج كبيرة ومشاريع اختبار لغوي مكثّفة؛ بقبول انتقائي | متوسط |
| Scale AI وOutlier | تقييم البيانات، وبرنامج مستقلّين متعدّد اللغات | مبتدئ |
| DataAnnotation | تقييم استجابات النماذج وكشف إخفاقاتها | مبتدئ |
| Invisible Technologies | عمليات ذكاء اصطناعي لشركاء كبار | متوسط |
| OpenAI Red Teaming Network | شبكة خبراء خارجيين بطلب رسمي | متقدّم |
| وظائف شركات النماذج | باحث سلامة ومهندس اختبار بدوام كامل | متقدّم |
ورشة تطبيقية: بيان النطاق#
المخرَج العملي لهذا الدرس بيان نطاق (Scope Statement) احترافي لاختبار نموذج محادثة عربي افتراضي، من ثلاث إلى خمس صفحات، يصلح لملف أعمالك.
حلّل بطاقة نموذج منشورة
استخرج من بطاقة نموذج حديث خمس منهجيات اختبار، ووثّقها بصيغة تكتيك وتقنية وإجراء.
قارن نسختي OWASP
بين 2023 و2025: ما الثغرات المستحدثة، ولماذا أُضيفت؟
طبّق NIST على حالة حسّاسة
نموذج ترجمة عربي-إنجليزي يُستخدم في محكمة: ما المخاطر في كل وظيفة من الوظائف الأربع؟
اكتب بيان النطاق
الأهداف، والحدود (ما لن يُختبر)، والتهديدات المتوقّعة، ومعايير النجاح، ومنهجية التقييم، وقواعد الكشف المسؤول.
عشرون مصطلحًا أساسيًّا#
| المصطلح | بالعربية | المعنى |
|---|---|---|
| Red Teaming | الاختبار العدائي | محاكاة هجمات لكشف الثغرات قبل النشر |
| Jailbreaking | كسر الحماية | تجاوز قواعد السلامة بصياغات ذكية |
| Prompt Injection | حقن التعليمات | تعليمات خفيّة تتجاوز نيّة المطوّر |
| Alignment | المحاذاة | مطابقة السلوك للقيم المقصودة |
| Robustness | المتانة | ثبات الأداء أمام المدخلات الشاذّة |
| Hallucination | الهلوسة | معلومات خاطئة بثقة وأسلوب مقنع |
| Bias | التحيّز | انحياز منهجي تجاه فئة معيّنة |
| Harm Taxonomy | تصنيف الأضرار | منظومة لتصنيف أنواع الضرر |
| Guardrails | حواجز الحماية | طبقات تفرض قواعد على المخرجات |
| Responsible Disclosure | الكشف المسؤول | إبلاغ المطوّر قبل الإعلان العام |
| Scope Statement | بيان النطاق | حدود عملية الاختبار وأهدافها |
| RSP | سياسة التوسّع المسؤول | سياسة Anthropic لإدارة مخاطر النماذج القوية |
| Model Card | بطاقة النموذج | وثيقة قدرات النموذج وحدوده ومخاطره |
| Adversarial Examples | الأمثلة العدائية | مدخلات مصمّمة لخداع النموذج |
| Data Poisoning | تسميم البيانات | بيانات خبيثة في التدريب تحرّف السلوك |
| Model Leakage | تسريب النموذج | كشف بيانات تدريب حسّاسة عبر الردود |
| Back-translation | الترجمة العكسية | ترجمة النص ثم إعادته لكشف فقد المعنى |
| Chain-of-Thought | سلسلة التفكير | إظهار خطوات الاستدلال |
| Many-Shot Jailbreak | كسر الحماية بالأمثلة الكثيرة | استغلال نوافذ السياق الطويلة |
| AI Agents | الوكلاء | أنظمة تنفّذ إجراءات مستقلّة |
اختبر فهمك
منع أمر مدفون داخل مستند يترجمه النموذج من أن يُنفَّذ: إلى أي ركن ينتمي؟
حماية النظام نفسه من التلاعب بتعليماته مسألة أمن، وتقابل LLM01 في OWASP.
اختبر فهمك
أي الأطر الأربعة تشريع ملزم قانونًا؟
NIST طوعي، وOWASP مرجع مجتمعي، وATLAS مصفوفة تكتيكية؛ أما القانون الأوروبي فلائحة ملزمة.
اختبر فهمك
اكتشفت ثغرة خطيرة أثناء اختبار مأذون. ما التصرّف الصحيح؟
المختبِر يكشف ليصلح المطوّر، لا ليستغلّ أو يشهّر.