المشكلة الخفية في الـ Naive RAG#
عندما تبني نظام دردشة مع مستندات الشركة، فإن الطريقة التقليدية (تقطيع النص إلى قطع 500 حرف، ثم توليد Vector لكل قطعة) تفشل فشلاً ذريعاً مع:
* المصطلحات الدقيقة وأرقام القوانين (مثال: "المادة 142 فقرة ب"). التضمين المتجه يراها مجرد "نص قانوني عام"!
* فقدان سياق الفقرة الأصلية بسبب التقطيع العشوائي للنص.
تقنية Late Chunking الثورية#
بدلاً من تقطيع المستند قبل إدخاله في نموذج التضمين، نقوم بتمرير المستند كاملاً داخل نموذج التضمين ليحسب العلاقات بين كل الكلمات أولاً، ثم نقطع مصفوفات التضمين بعد ذلك. والنتيجة: كل قطعة تحتفظ بذاكرة المستند بالكامل!
المهنة الجديدة: مهندس قواعد المعرفة والاسترجاع الذكي (RAG Knowledge Engineer)#
لا غنى عنه في كل بنك وشركة اتصالات ومؤسسة تبحث عن الاستفادة من أرشيفها الضخم دون تسريب أو هلوسة:
* المسؤوليات: هندسة بنية البيانات، اختيار قواعد البيانات المتجهة (مثل Qdrant أو Milvus)، وضبط نماذج إعادة الترتيب (Cross-Encoder Rerankers).
