السلام عليكم ورحمة الله وبركاته،
أحببت اليوم أن أشارك معكم أحد المشاريع التي عملت عليها خلال آخر 8 أشهر، وأتمنى الاستفادة من آرائكم واقتراحاتكم.
بدأت الفكرة من ملاحظة بسيطة.
كل يوم كنت أرى صناع المحتوى القرآني يقضون ساعات طويلة لإنتاج فيديو واحد.
العملية كانت دائمًا متكررة:
اختيار التلاوة.
قص الجزء المطلوب.
كتابة الآيات.
مزامنة كل كلمة مع صوت القارئ يدويًا.
إضافة الحركة والتأثيرات.
تصدير الفيديو بأكثر من مقاس.
ولو أراد الشخص نشر عدة مقاطع في اليوم، كان يعيد نفس الخطوات مرة بعد مرة.
وقتها سألت نفسي:
هل يمكن تحويل هذه العملية بالكامل إلى ضغطة زر؟
ومن هنا بدأت رحلة بناء Quran Reels داخل Tashghil.Pro
في البداية ظننت أن الأمر بسيط.
قلت سأستخدم نموذجًا لتحويل الصوت إلى نص، ثم أربط الناتج بالآيات.
لكن بعد أول تجربة اكتشفت أن القرآن الكريم ليس كأي محتوى صوتي.
ظهرت تحديات لم أكن أتوقعها، مثل:
اختلاف الرسم العثماني عن الكتابة العربية المعتادة.
علامات الوقف والزخارف.
المدود والغنة وأحكام التجويد.
اختلاف طريقة نطق بعض الكلمات بين القراء.
الوقفات الطويلة داخل الآيات.
الحاجة إلى معرفة توقيت بداية ونهاية كل كلمة بدقة.
وهنا أدركت أن المشكلة الحقيقية ليست استخراج النص، بل مطابقة الصوت مع النص القرآني بدقة عالية.
رحلة التجارب
خلال التطوير جربت أكثر من نموذج وأكثر من طريقة.
من بينها:
AssemblyAI Universal-2
نماذج Whisper
Web Audio API
FFmpeg
WebCodecs
لكنني لم أكن أبحث عن أفضل نموذج فقط، بل عن أفضل Pipeline كاملة.
كنت أقيس في كل تجربة:
دقة توقيت الكلمات.
سرعة المعالجة.
جودة الفيديو النهائي.
استهلاك الذاكرة.
الوقت اللازم للتصدير.
وفي كل مرة كانت تظهر مشكلة جديدة.
أصعب تحدٍ واجهته
كان الحصول على Word-Level Alignment حقيقي مع النص القرآني.
فحتى عندما تكون نتيجة التعرف على الكلام صحيحة بنسبة كبيرة، قد يختلف شكل الكلمة عن الرسم الموجود في المصحف، أو تختلف طريقة النطق، أو توجد علامات وقف لا ينبغي أن تؤثر على المزامنة.
لذلك لم يكن الاعتماد على نموذج الذكاء الاصطناعي وحده كافيًا.
اضطررت إلى بناء طبقة معالجة إضافية تقوم بـ:
تطبيع النص قبل المقارنة.
مطابقة الكلمات مع الآيات.
معالجة اختلافات الرسم العثماني.
تصحيح الانحرافات في التوقيت.
إعادة بناء الترتيب النهائي للكلمات قبل إنشاء الفيديو.
وهذه كانت أكثر مرحلة استغرقت وقتًا في المشروع.
ثم ظهر تحدٍ آخر
بعد نجاح المزامنة، ظهرت مشكلة التصدير.
كنت لا أريد أن يرفع المستخدم ملفات كبيرة إلى الخادم وينتظر انتهاء المعالجة.
لذلك اعتمدت على تنفيذ جزء كبير من العمل داخل المتصفح باستخدام تقنيات مثل:
WebCodecs
Web Workers
Canvas API
FFmpeg WASM
بحيث يتم إنشاء الفيديو بأفضل أداء ممكن مع تقليل الضغط على الخادم، والحفاظ على تجربة استخدام سلسة.
النتيجة الحالية
أصبح المستخدم يستطيع:
اختيار القارئ.
اختيار السورة أو الآيات.
اختيار تصميم الفيديو.
تخصيص الخطوط والألوان.
إنشاء فيديو جاهز للنشر خلال دقائق، مع مزامنة الكلمات تلقائيًا.
ويدعم المشروع حاليًا:
أكثر من 215 قارئًا.
آلاف التلاوات.
عدة قوالب للفيديو.
التصدير الرأسي والأفقي والمربع.
فيديوهات مناسبة لـ Reels وShorts وTikTok.
أكثر شيء تعلمته من هذه الرحلة
كنت أعتقد أن أصعب جزء سيكون الذكاء الاصطناعي.
لكن بعد أشهر من العمل اكتشفت أن الذكاء الاصطناعي كان مجرد جزء من الحل.
التحدي الحقيقي كان في هندسة النظام بالكامل.
كيف تربط عدة تقنيات مختلفة معًا، وكيف تتعامل مع التفاصيل الدقيقة للنص القرآني، وكيف تقدم تجربة بسيطة للمستخدم بينما يحدث كل هذا التعقيد في الخلفية.
وهذا بالنسبة لي كان أهم درس تعلمته من المشروع.
ما زال المشروع في مرحلة التطوير، وأعمل باستمرار على تحسين الدقة والأداء وإضافة مزايا جديدة.
يسعدني جدًا سماع آرائكم، خصوصًا من لديه خبرة في:
Speech Recognition
Media Processing
WebCodecs
AI Pipelines
أو أي أفكار لتحسين تجربة المستخدم.
الموقع:
https://tashghil.pro
أسأل الله أن يجعل هذا العمل خالصًا لوجهه الكريم، وأن ينفع به المسلمين، وجزاكم الله خيرًا مقدمًا على أي ملاحظة أو اقتراح. 🤍





