علي حسب إطلاعي يعتبر مؤتمر Arabic NLP هو المبادرة الأقوى في هذه الجزئية برغم من سهولة الكثير من المهام فيها وبساطة الحلول الي تم تقديمها في المؤتمر زي حلول الكشف عن الهلوسة مثلا.
المراكز المهتمة بعمل أبحاث عن معالجة النص القرآني قليله جدا لكن من المراكز المهتمة باللغة العربية :
١. https://huggingface.co/MBZUAI
٢. https://huggingface.co/CAMeL-Lab
٣. https://sina.birzeit.edu/index.html
٤. https://huggingface.co/NAMAA-Space
- https://arbml.github.io/
السبب لعدم وجود حلول مفيده من وجود نماذج قوية في اللغة العربية الي حتي أبسط الأمور مثل نماذج البحث الضمني embedding models
وعدم وجود نظام قوي للمقارنة بين قوة النماذج الموجوده لكافة المهام مثل :
١. المسح الضوئي للملفات
٢. تحويل النص الي كلام
٣. فهم النماذج للغة من ناحية الإعراب و قدراته علي توليد الشعر و أوجه القصور في ذلك
٤. قدرة نماذج التضمين علي البحث و إستراجاع المعلومات
سبب أخر هو عدم الدمج بين تقنيات أخري مثل :
- knowledge graph
- Lexical understanding
وتحليل أسباب القصور في هذه النماذج يعود الي الإعتماد الكلي علي النماذج الأخري ومحاولة تدريبها لتكون ممتازة في اللغة العربية بدون وعي لأسباب القصور الرئيسية في هذه النماذج فمثلا النماذج التوليدية تبني باستخدام مقطع كلمات غير مناسب للمهمة اللغوية مثل فهم الكلمة العربية بشكل مناسب أو استخدام بيانات لتدريب من مصادر بعيده كل البعد عن اللغة العربية والتراث الإسلامي وبالتالي النص القرآني ومعانيه ..والتفصيل هنا يحتاج مقال لذاته.
مثال للتاكيد في حالة النماذج المعروفة للتضمين مثل AraBert و AraModernbert
ستجد أن اكبر حجم لتدريب البيانات كانت ١٠٠ جيجا فقط ومعظمها نصوص من الويب فهل تتوقع من هذه النماذج ان تساعد في فهم اللغة العربية؟
والصعوبة الحقيقة ليست في بناء نماذج من الصفر وتدريبها علي فهم النص العربي ولكن المشكلة الأكبر هي وجود منصات لقياس الأداء للمهام بشكل عادل وقوي يشجع الباحثين علي تطوير نماذج تتغلب علي هذه المهام.