أشكرك علا على نقل النقاش للمجتمع بهذا الشكل المفتوح، وهو امتداد طبيعي للنقاش اللي دار بينّا، وكنت صاحبة الرأي المتفائل من البداية :)
أرى أن الرأي الأول أقرب للدقة إذا حددنا المقصود بالنضج. فوجود فجوات حقيقية في التقنية لا يعني بالضرورة أنها غير ناضجة؛ قد يعني أننا انتقلنا من مرحلة إثبات إمكانية التسميع إلى مرحلة تحسينه وتوسيعه.
أوضح ذلك سريعًا في نقاط:
1. الاعتماد على السحابة ليس دليلًا على عدم النضج.
هو خيار معماري يسمح باستخدام نماذج أكبر وأكثر دقة. تشغيل النماذج محليًا هدف مهم، لكن الوصول إليه عبر التقطير والضغط والتكميم هو مسار تطوير، وليس شرطًا للحكم على نضج التقنية.
2. نقص بيانات بعض الروايات لا يعني عدم نضج التسميع في النطاق المدعوم.
هناك فرق بين أن تكون التقنية ناضجة في حفص، وبين أن تكون مكتملة لكل الروايات. دعم ورش وقالون وغيرها يمثل توسعًا مهمًا، لكنه لا يلغي ما تحقق بالفعل في النطاقات التي تتوفر لها بيانات ونماذج جيدة.
3. وصلنا بالفعل إلى ما هو أبعد من مجرد التعرف على الكلام.
وهذه بالنسبة لي أهم نقطة. المعلم القرآني يحلل التلاوة عبر ثلاث مستويات مترابطة: الفونيم (صحة نطق الحرف)، الصفة الصوتية (كالهمس والجهر والشدة والرخاوة)، وحكم التجويد (كالمد والغنة)، عبر بنية Multi-Level CTC تنتج 11 سلسلة صوتية متخصصة، وليس مجرد نموذج تقليدي يحوّل الصوت لنص فقط.
ونموذج zipformer_p-arabic-v3 من QuranLab يسير في الاتجاه نفسه: نموذج CTC خالص بلا مصحح لغوي يخفي أخطاء القارئ، يخرج المد بطوله والغنة والقلقلة والحروف المفخمة كرموز صوتية مستقلة، ويعمل محليًا بلا إنترنت بحجم 65 مليون معامل فقط.
وطبعًا لسه في تحديات حقيقية على أرض الواقع: نطاق القواعد المفعّلة فعليًا في واجهة المعلم القرآني حاليًا محدود (القلقلة والمدود، والباقي على خارطة الطريق حسب الفريق نفسه)، وzipformer بيصرّح بنفسه إنه لسه ما بيلتقطش الصفات اللي ما بتغيّرش الفونيم الأساسي كنقص الهمس والشدة والرخاوة. لكن ده تحدٍّ في تحسين التغطية داخل بنية موجودة بالفعل ومثبتة الجدوى، مش دليل على عدم القدرة الأساسية على هذا العمق من التحليل..
4. أما بيانات SAWT، فأرى ضرورة التمييز بين نوع البيانات والمهمة.
طلب التسجيلات الخام كان مرتبطًا أساسًا بمشروع ترميم وتحسين الصوت، ويمكن أن يخدم لاحقًا بناء موارد أفضل، لكنه ليس بحد ذاته دليلًا على عدم وجود بيانات كافية لتدريب نماذج التسميع.
لذلك خلاصة موقفي ليست أن «المشكلة انتهت» أو أن التطبيقات وصلت للكمال.
بل العكس: الفجوات المذكورة حقيقية ومهمة، وأراها خريطة ممتازة للمرحلة القادمة.
لكن الفرق الذي أراه جوهريًا هو:
النضج لا يعني الاكتمال.
في تقديري، لم نعد في مرحلة هل تستطيع الآلة أن تسمّع القرآن؟، بل أصبح السؤال: كيف نجعلها أدق، وأوسع في الروايات، وأعمق في تحليل التجويد، وأقل اعتمادًا على السحابة؟
وده في رأيي وصف لمرحلة نضج وتطوير، وليس مرحلة تقنية لم تنضج بعد.
علا صالح