انتشرت في الآونة الأخيرة تطبيقات تولد فيديوهات قرآنية عبارة عن تلاوة بصوت قارئ مع نص الآيات على الشاشة وخلفية مناسبة. لكن هذه التطبيقات واجهت مشكلة تجعل من الصعب على المستخدم الاعتماد عليها
اعتمدت فكرة أغلب هذه التطبيقات على وضع نص الآية كاملة في إطار واحد ثابت طوال مدة تلاوتها. هذا يعمل جيدا نسبيا مع الآيات القصيرة، لكنه يسبب مشكلة واضحة مع الآيات الطويلة، حيث تبقى الشاشة مليئة بنص طويل دون أي إشارة لموضع القارئ الفعلي داخل الآية. هنا برزت الحاجة الحقيقية للتزامن بين الصوت والصورة على مستوى الكلمة لا على مستوى الآية فقط.
وكان الحل الأول هو أسلوب الكاريوكي (التقسيم الحسابي): تقسيم مدة التلاوة بالتساوي على عدد الكلمات. طبعا الحل سيئ جدا من الناحية العملية، لأن الكلمات لا تُتلى بنفس المدة الزمنية؛ فبعض الكلمات أطول نطقًا من غيرها، وبعضها يُمد فيه أو يُسكّن عليه.
الحل الثاني المزامنة بالذكاء الاصطناعي: مع ظهور نماذج تفريغ صوتي قوية ومفتوحة المصدر مثل Whisper من Open AI، وكذلك النسخة المتخصصة منه التي تم تدريبها على القرآن الكريم تحديدا، ظهرت أدوات كثيرة تعتمد على هذا الأسلوب. لكنه يحمل مشاكله الخاصة:
- تكلفة تشغيل واستهلاك موارد عاليان، يصعبان على أغلب المستخدمين العاديين.
- بطء نسبي في وقت المعالجة، خاصة إن لم تتوفر أجهزة قوية.
- أخطاء لا يمكن إنكارها، خصوصًا مع بعض القرّاء الذين يعتمدون على السكتات الطويلة أو دمج بعض الكلمات في منتصف التلاوة، مما يربك النموذج.
الحل: الاعتماد على بيانات توقيت مُعدة مسبقا
بدل الانتظار في كل مرة لتشغيل نموذج ذكاء اصطناعي ثقيل، اعتمد هذا المشروع على بيانات جاهزة أُنتجت مسبقًا من مشروع quran-align، وهو مشروع متخصص في توليد توقيت دقيق على مستوى الكلمة لتلاوات القرآن الكريم، معتمدًا في تسجيلاته الصوتية على موقع everyayah.
ما الذي أضافه هذا المشروع فوق بيانات quran-align؟
- معالجة هذه البيانات وتجهيزها للاستخدام المباشر في توليد الفيديو دون الحاجة لأي خطوة وسيطة.
- استخراج ومراجعة الآيات التي بها أخطاء في التوقيت أو التي لا يوجد لها توقيت أصلًا، لضمان عدم استخدام بيانات غير موثوقة.
ميزة هذا الحل
لا حاجة لتشغيل أي نموذج ذكاء اصطناعي عند كل استخدام؛ المزامنة جاهزة ودقيقة مسبقًا، فينتج فيديو بمزامنة كلمة بكلمة بسرعة عالية واستهلاك موارد منخفض جدًا مقارنة بحلول Whisper. عدد الآيات التي بها أخطاء هي 25 آية فقط أي أن نسبة الخطأ تقريبا 0.4% وبلغت عند قراء آخرين مثل المنشاوي 0.7% وعبد الباسط عبد الصمد 0.8% أي أن كلها أقل من 1%
عيب الحل حاليًا
الاكتفاء بقارئ واحد فقط في هذه المرحلة، وذلك بهدف اختبار المحرك (engine) والتأكد من سلامته 100% قبل التوسع. إضافة قرّاء آخرين ليست عائقًا تقنيًا كبيرًا، وإنما خطوة تالية مخطط لها.
بينما تتجه أغلب الحلول الحديثة إما نحو تقسيم حسابي بسيط وغير دقيق، أو نحو الذكاء الاصطناعي بتكلفته وأخطائه المحتملة، حاولت تقديم طريقا وسطا عمليا: الاستفادة من عمل بحثي متخصص وجاهز (quran-align) بدل إعادة اختراعه، مع معالجة إضافية لضمان جودة البيانات. النتيجة أداة خفيفة وسريعة ودقيقة، وإن كانت لا تزال في مرحلة مبكرة من ناحية عدد القرّاء المدعومين.
يمكن استخدامها عبر تحميلها وتشغيلها على الجهاز، لتوليد مقطع مدته 30 ثانية تحتاج تقريبا 50 ثانية من العمل على جهاز متوسط بدون كارت شاشة حتى
ويمكن استخدامها عبر GitHub Actions من المتصفح مباشرة دون تحميل الأداة
رابط المشروع: avax43/Quran-Video-Generator
وقد أرفقت بعض الصور من الأداة ومن بعض الأدوات الأخرى:
صورة 1 من الأداة

صورة 2 من الأداة

صورة 3 من أداة موقع quran.com

صورة 4 من أداة quran video maker
