بارك الله في الجهود، وما شاء الله على هذه الخطوة المنهجية في توحيد المعيار قبل البدء بالجمع.
القائمة الحالية أساس ممتاز، وأود إضافة بعض المقترحات من منظور تدريب النماذج:
بخصوص العمر: أقترح الإبقاء عليه كرقم دقيق لا كفئات عمرية. في نماذج الكلام المبنية على الشبكات العصبية مثلا، العمر بالتحديد مؤثر على مخارج الحروف بشكل ملحوظ، يعني الطفل الصغير بيختلف عن المراهق مثلا، وكمان مع اختلاف الجنس بتزيد التباينات خصوصا في الحروف المفخمة والمرققة، لان صوت المراهق عادة أجش وده بيؤثر على نطقه للحروف مقارنة بالفتيات في نفس العمر. هذه التفاصيل الدقيقة قد تكون فارقة في دقة النموذج.
القائمة الحالية بتغطي الجانب الديموغرافي بشكل جيد جدا، لكن فيه بيانات ممكن تحسن من جودة النماذج زي مثلا:
الرواية والقراءة التي يتلو بها القارئ، لأن الأحكام بختلف بين القراءات بل حتى بين الرواه عن نفس القارئ زي أحكام الإمالة مثلا والإشمام والروم
نوع التلاوة: مجوَّد أو مرتَّل أو حدر، لأن معايير التقييم بتختلف بناء عليها
وحاجة مهمة هي مستوى الإجازة أو سنوات الدراسة في التجويد
ممكن برضو بيئة التسجيل: زي الجهاز، ومستوى الضجيج، والمكان. لأن النموذج لازم يتعلم يفرق بين خطأ في النطق وخطأ في جودة الصوت.
وأقترح أن يكون فيه تقييمين: تقييم ذاتي من القارئ، وتقييم موضوعي من مختص. الفجوة بينهم أحيانا بتكون بيانات في حد ذاتها.
وبخصوص ملاحظة رقية عن صعوبات النطق، فده مقترح مهم جدا ويمكن معالجته بحقل "ملاحظات صوتية" بدون الخوض في تفاصيل طبية، بحيث يُعلَّم النموذج أن القارئ ده تحديدا عنده خصوصية في النطق فلا تُصنف قراءته انها خطأ في المطلق.