أصدرت شركة كوهير قبل شهر من الآن نموذجاً جديداً مختصّاً بالتفريغ النصّي للغة العربية، وقد تناقشت مع الأخ @علي ملص في محادثة خاصة حول هذا النموذج وإن كان يمكن استخدامه للتزمين في أدوات تزمين القرآن الكريم، لكن ريثما ينظر هو في تفاصيل النموذج، قررت اختباره اختباراً عاماً بخصوص التفريغ والتزمين العام، وهذا بالمقارنة مع ويسبر بنسختين large-v2 و large-v3
سبب اعتمادي للنموذجين المذكورين هو أنّهما الأفضل من ناحية تفريغ اللغة العربية نصياً، وقد تعاملت معهما من قبل في مشروع شخصيّ مركّز على تفريغ النصّ والتزمين للفيديوهات بغرض اقتطاعها تلقائياً بناء على المواضيع المذكورة فيها، وكانها هما الخيار الأساسيّ للنماذج المحلية التي يمكن استخدامها في المشروع.
بعد هذه التجربة، اعتمدت على نموذج كوهير كنموذج افتراضي في المشروع فهو في حالتي بشكل واضح أفضل من نماذج ويسبر وأدقّ في التعامل مع اللغة العربية، النتائج التي حصلت عليها كانت مرضية جداً عند إعطاء تسجيلات باللهجة الشامية والخليجية والمصرية، إضافة لكونه أسرع من نماذج ويسبر بستّ مرّات تقريباً.
أترككم مع نتائج المقارنة والاختبار الذي أجريته، وأنصحكم بتجربة النموذج في المشاريع التي تعتمد على التفريغ النصي والتزمين باللغة العربية.
ملاحظة: بالنسبة للتزمين، هذا النموذج لا يدعم التزمين الدقيق بشكل افتراضي وفي صفحة النموذج على huggingface ستجد أنّهم ذكرو أنه لا يدعم التزمين، لكن باستخدام دوال التزمين من huggingface يمكن الحصول على نتائج جيدة على مستوى الجملة، وهذا كافْ في حالتي.
ملاحظة 2: قرأت في الفترة السابقة عن بعض الخدع التي تقوم بها بعض المنصات لتخفيض التكاليف بخصوص معالجة الصوتيات ومنها موضوع تسريع الصوت لضعفين أو مرة ونصف لاختصار وقت المعالجة، وقد استغللت هذه التجربة أيضاً لتجربة هذا، وبالفعل، حقق نتائج مقبولة جداً بتسريع جيد للعملية.
صورة 1: المقارنة بين زمن المعالجة وزمن التسجيل الأصلي - مضاف إليها محاولة التسريع بقيمة 1.5 للتسجيل وتأثيرها على هذا المعيار

صورة2: حجم كل "كتلة" نصية يتم تفريغها، كل ما كان أقل كل ما كان التزمين أقرب لمستوى الجملة الواحدة

بالنسبة لجودة التفريغ فهي متقاربة، في حالة كوهير، النموذج يميل لتحويل الكلمات الإنجليزية المذكورة ضمن سياق الحديث العربي إلى أحرف عربية، مثلاً يكتب artist بصيغة "أرتيست" هكذا، بينما نموذج ويسبر يكتبها بالأحرف الإنجليزية، شخصياً أجد أنّ ما يقوم به نموذج كوهير معقول أكثر خصوصاً أن نموذج ويسبر يخطئ بسبب هذا في بعض الأحيان في تفسير بعض الكلمات العربية العامية لكتابتها بالإنجليزية.
روابط:
- النموذج على huggingface: من هنا
- تدوينة كوهير حول النموذج: من هنا