جزلكم الله خيرا على الكلام الطيب المشجع حقيقة أخي الفاضل.
الحقيقة نحن دربنا النموذج و لازلنا ندرب على تلاوات المشايخ المعروفين و قد أعطت نتائج طيبة، و لكن الان نحن نريد تدريبها على قراءات مستخدمين حقيقيين عاديين من خلفيات مختلفة و لهجات غير عربية سليقة حتى تتمكن من معرفة الاخطاء و كيفية تصحيحها.
متطلبات مجموعة البيانات
فيما يلي نظرة عامة على نوع مجموعة البيانات التي نسعى لجمعها.
نبذة عن المقرئين:
نسعى للحصول على تسجيلات من مجموعة واسعة من المساهمين من الجمهور، بما في ذلك:
• متحدثون من الذكور والإناث
• تتراوح أعمارهم بين 7 و60 عامًا تقريبًا.
• متحدثون من خلفيات لغوية ولهجات مختلفة، بما في ذلك (على سبيل المثال لا الحصر): الملايو، والإندونيسية، والأردية، والهندية، والإنجليزية، والفرنسية. لأن قراءتهم مختلفة عن قراءة العربي سليقة، و عندهم أخطاء في نطق الحروف بشكل كبير و واضح.
بيئة التسجيل
لضمان أن تعكس مجموعة البيانات الاستخدام الواقعي مع الحفاظ على الجودة، يُفضل تسجيل الأصوات في بيئات هادئة مثل:
المنازل، والمكتبات، والمساجد، وأماكن مماثلة ذات ضوضاء خلفية منخفضة.
صيغة الصوت
• صيغة MP3.
• آية واحدة لكل ملف صوتي.
• يجب تسجيل كل سورة آية بآية، مع حفظ كل آية كملف صوتي منفصل.
متطلبات البيانات الوصفية
نحتاج أيضًا إلى بيانات وصفية مصاحبة لكل تسجيل، تشمل ما يلي:
• الفئة العمرية.
• الجنس.
• البلد.
• اسم السورة.
• رقم الآية في كل سورة.
حجم مجموعة البيانات المستهدفة
هدفنا المبدئي هو جمع ما يقارب 500 إلى 1000 ساعة من تلاوات القرآن الكريم.
جزاكم الله خيرا على مروركم و مساهمتكم الطيبة أخي.
تقبلوا تحيات كامل فريق فصيح Faseeh AI