مع تزايد الاهتمام ببناء نماذج ذكاء اصطناعي عربية مثل علّام (ALLaM) و جيس (Jais)، خطر لي سؤال مهم في السياق القرآني، وهو: هل البيانات القرآنية المتاحة حاليًا كافية وموثوقة لتدريب نماذج يمكننا الاعتماد عليها؟
وعند البحث عن إجابة لهذا السؤال، تبين لي أن الإجابة تميل للنفي، لأن البيانات المتوفرة تتضمن مشاكل عدة تمنع هذا الأمر، وأهمها:
مشكلة المصدر المجهول
بناء على قاعدة أن النص الشرعي يتطلب إسنادًا لكي يصبح ذا قيمة، فإن الـ Datasets المفتوحة والموجودة على منصات مثل (Hugging Face) أو (GitHub) بوسم Quranic Dataset ليست صالحة لتدريب نماذج قرآنية، لأنها تعاني من عيبين مهمين:
مجموعة من مواقع ومنتديات غير رسمية عبر تقنيات مثل Web Scraping.
لا يوجد توثيق للجهة المدققة أو طبعة المصحف المعمدة.
وإذا دربنا نموذجًا على هذه النسخ الإلكترونية التي قد تتضمن أخطاء بشرية، سيعيد الذكاء الاصطناعي إنتاج تلك الأخطاء.
انحراف نحو العربية الحديثة
يتم تدريب نماذج الذكاء الاصطناعي بالاعتماد على البيانات المتوفرة مثل تلك المستخرجة من ويكيبيديا، وهذه البيانات المتوفرة منحازة بشكل كبيرة للغة العربية المعاصرة، وبالتالي عندما يتم تدريب نموذج عليها فإنه يتدرب على مليارات الكلمات المعاصرة في مقابل نسبة ضئيلة من النصوص الدينية أو التراثية، ولهذا فإن النموذج سيهمل الكلمات القرآنية، ويركز على الكلمات المعاصرة.
هذا الأمر يلوث فهم النموذج للقرآن، فكلمة سيارة مثلًا سترتبط إحصائيًا في عقل النموذج بالسيارة ذات المحرك والعجلات، ما يصعب عليه استحضار معناها القرآني (القافلة).
الأخطاء الموجودة في البيانات القرآنية
جزء كبير من البيانات العربية التي يتم تدريب النماذج عليها تحتوي على نصوص لأشخاص يقتبسون القرآن من ذاكرتهم في المنتديات ووسائل التواصل، وربما يقعون في أخطاء مثل دمج الآيات.
وعندما تدريب الذكاء الاصطناعي على مثل هذه البيانات التي تتضمن أخطاء، فإنه قد يتعلم مثلًا أن دمج بداية آية مع نهاية آية أخرى أمر مقبول وصحيح. وهذا سيؤدي إلى إنتاج آيات مركبة تبدو صحيحة لغير الحافظ، لأنها موجودة ضمن بيانات التدريب.
بناءً على ما سبق، هل ترون أن الحل يكمن في تنظيف هذه البيانات، أم نحن بحاجة لإطلاق مبادرة لبناء (Gold Standard Quranic Dataset) من الصفر؟