جزاك الله خيرا يا أخ محمد
جربت نسخة الـ fastconformer من فرع «الحمد لله» زي ما نصحتني، والنتيجة طلعت أحسن مما توقعت بفضل الله
بخصوص قالون، الموديل حاذاه بدقة كويسة رغم أنه مدرب على حفص
اللي عملته أني بدلت data/qpc_hafs.json بفهرس كلمات مبني من مصحف الجماهيرية
6214 آية و 77909 كلمة، بنفس بنية الملف
فصار الإخراج مرقم بترقيم قالون مباشرة بدون أي تحويل بعدها
الأرقام لحد الآن والمعالجة لسه شغالة:
229 سورة من 3 قراء، فيهم ختمتين كاملتين
47 ساعة صوت
تغطية الكلمات 96.1%
متوسط الثقة 91.2%
بدون أي ملف فاشل
والسبب اللي خلاه ينجح على قالون على ما يبدو لي
أن أغلب الفروق بين قالون وحفص فروق ضبط ورسم
والـ DP عندك يشتغل على مستوى الحرف مع هامش تحرير
فاختلاف حرف واحد لا يسقط الكلمة
وهذي ملاحظات طلعت معي وقت الشغل، يمكن تفيدك:
1) نسخة q8 تخرج كلام غير مفهوم على معالجات x86_64
على السيرفر عندي، أوبنتو x86_64، أعطتني ناتج مشوش تماما، شيء مثل «ال م ال الي»
ونفس المقطع بنفس اللحظة وعلى نفس الجهاز طلع صحيح بالنسخة كاملة الدقة
وعلى ماك بمعمارية ARM نسخة q8 تشتغل عادي
يعني يبدو عدم استقرار عددي في التكميم مرتبط بالمعمارية
وممكن يكون هذا سبب شكاوى الدقة عند ناس دون ناس
2) الموديل ينهار إذا تعدى الإدخال 11 ثانية تقريبا
أي مقطع أطول يرجع فاضي أو شبه فاضي
جربتها على الثلاث نسخ، q8 وmixed وكاملة الدقة، ونفس السلوك
والمشكلة أن _detect_non_silent_fast يمرر الملف كامل في نداء واحد إذا كان أقصر من 180 ثانية
ويستهدف مقاطع توصل 38 ثانية
فأي مقطع طويل بدون سكتات واضحة يرجع لا شيء، وهذا وارد كثير مع القارئ سريع الأداء
حليتها بتقسيم إجباري عند أهدأ نقطة حتى ينزل كل مقطع تحت السقف
3) AnchorParams.segments = 5 ممكن يسقط ملف كامل
التصويت يشوف أول خمس مقاطع فقط
فإذا كانت مقدمة أو استعاذة أو ضجيج، ما يلقى أي n-gram ويترك الملف كله
مع أن التلاوة بعدها نظيفة تماما
عندي ثلاث سور فشلت بـ Could not anchor to any chapter، وهي مريم والذاريات والبروج
ولما وسعت النافذة إلى 30 نجحت الثلاثة
خليتها محاولة احتياطية تشتغل فقط لما الافتراضي يفشل، حتى لا يتغير سلوك الملفات الناجحة
4) تكرار الكلمة الواحدة مرتين
لما ينقسم الصوت داخل الكلمة نفسها، يعني نفس القارئ في وسط كلمة طويلة، الجزئين ينكتبوا منفصلين
ولأن lookback_words = 30 مع start_prior_weight = 0.005
الجزء الثاني يطابق نفس الكلمة اللي استهلكها الأول
فتطلع بموضع واحد وتوقيتين
والأثر الجانبي أن الـ CTC يضغط باقي كلمات المقطع في الزمن الباقي
فيبان التظليل كأنه سابق صوت القارئ ثم يلحقه عند آخر كلمة
في سورة البقرة لحالها لقيت 752 حالة
5) فيه فرق مهم بين المطابقة والـ anchoring
الـ DP متسامح مع اختلاف الحرف
لكن فهرس الـ n-gram يريد تطابق تام لعشرة أحرف
هذا علاش رموز رسم الجماهيرية، مثل الياء ے وهي أظن ليست ضمن أبجدية الموديل فلا يقدر يخرجها
لا تضر المطابقة لكن تضعف الـ anchoring
وانتبهت لهذي بعد ما قست الأثر فعليا
تعديل التطبيع رفع تطابق النص من 86% إلى 98% لكنه ما غير التغطية الفعلية ولا حاجة
لأن المقياس الصحيح هنا ليس تطابق الكلمة التام
إذا تحب أرسل لك PR بهذي الإصلاحات على فرع «الحمد لله»
وبخصوص الـ dataset
يمكن هذا نفسه هو المخرج
نولد التوقيتات آليا بهذي الدقة وبعدين نراجعها بشريا، بدل ما نبنيها من الصفر
عملت واجهة مراجعة تعرض نص المصحف كامل وتظلل الكلمة مع الصوت
واللي ما طابقه المحاذي تعلمه بالأحمر
فتختصر المراجعة كثير
جزاك الله خير مرة ثانية ونفع بك