6 أكتوبر 2026
استيفاء الصور بالذكاء الاصطناعي: ما ينجح فيه، أين يفشل، وبأي أداة
الاستيفاء يخترع الصور الناقصة بين صورتين من فيديو، للانتقال من 24 إلى 30 أو 60 إطارًا في الثانية. اختباراتنا على رقصة سريعة وعلى وصلة بين لقطتين، Topaz في مواجهة RIFE، العيوب الواجب التعرّف عليها، والأدوات، من المجانية إلى الاحترافية.

Frank Houbreمؤسس Imaginode
ما يفعله نموذج الاستيفاء
يستقبل نموذج الاستيفاء صورتين متتاليتين، يقدّر انتقال كل منطقة من إحداهما إلى الأخرى، ويرسم صورة أو أكثر بينهما؛ وهو لا يعرف المشهد ولا ما حدث فعلًا بين اللحظتين.
بين صورتين من فيديو بمعدل 24 صورة في الثانية، يمر أربعة وعشرون جزءًا من الثانية. الاستيفاء يعني تخمين شكل المشهد في منتصف هذا الفاصل الزمني، أو عند ثلثه، أو ثلثيه، بحسب المعدل المستهدف. ولتحقيق ذلك، يحسب النموذج التدفق البصري: لكل منطقة صغيرة من الصورة الأولى، اتجاه ومسافة انتقالها في الصورة الثانية.
ومنه يستنتج صورة انتقلت فيها كل منطقة جزءًا من المسافة، ثم يملأ الفراغات: عندما تمر ذراع أمام جدار، يظهر جزء من الجدار، ويجب رسمه. هنا تتمايز النماذج. الخوارزميات القديمة، مثل مرشح minterpolate في ffmpeg، تعمل بمربعات وتترك حوافًا ممزقة. أما الشبكات العصبية المدرَّبة لهذه المهمة، RIFE وFILM ونماذج Topaz الخاصة، فتستدل على الصورة كاملة وتعيد بناء المناطق المكشوفة بشكل أفضل.
ما لا يستطيع النموذج فعله هو تخمين حدث لا يظهر في أي من الصورتين. رمشة عين سريعة جدًا، شرارة، كرة ترتد بين صورتين: لا يرى سوى حالة قبل وحالة بعد، ويرسم خطًا مستقيمًا بينهما. للاستخدام اليومي، أي تحويل لقطة من 24 إلى 30 أو 60 صورة في الثانية، لا يشكّل ذلك أي مشكلة. الطريقة الكاملة للتحويل موجودة في تحويل فيديو 24 إطارًا في الثانية إلى 30 إطارًا.
الاختبار الصعب: رقصة سريعة
على رقصة مُولَّدة بمعدل 24 صورة في الثانية، بحركة أذرع سريعة وضبابية حركية، أنتج Topaz وRIFE صورًا وسيطة نظيفة: لا طرف مضاعف، لا يد مشوَّهة، إذ أخفت ضبابية المصدر بقية العيوب.
كنا نتوقع ظهور الأعطال على اليدين. أخذنا فيديو رقص من كتالوج العروض التوضيحية لدينا، بدقة 720 × 1280، مدته 5 ثوانٍ، بمعدل 24 صورة في الثانية، ومررناه عبر محركين بتاريخ 6 أكتوبر 2026: Topaz، المحرك الذي تعتمد عليه عقدة التحسين، نحو 30 و60 صورة في الثانية، وRIFE، النموذج المفتوح الأكثر انتشارًا، الذي يضاعف المعدل إلى 48. ثم بحثنا، بالحساب، عن صورتين متتاليتين يتغيّر فيهما المشهد أكثر من غيرهما، ولاحظنا ما وضعه كل محرك بينهما.
النتيجة أفضل من المتوقع. في الاقتصاص أدناه، تنتقل اليد من الورك إلى الأمام؛ صورة RIFE وصورة Topaz تضعانها في منتصف المسافة، بضبابية متناسقة، دون إصبع سادس ولا ذراع شبحية. والسبب يعود جزئيًا إلى المصدر: فنموذج الفيديو يولّد ضبابية حركية على الحركات السريعة، كما تفعل كاميرا حقيقية، وهذه الضبابية تجعل أخطاء الاستيفاء غير مرئية.
ظهر فرق في مكان آخر: RIFE، على fal، يُخرج فيديو بلا صوت، بينما ينسخ Topaz مسار الصوت الأصلي. في لقطة صامتة، لا يهم الأمر؛ وفي إعلان له موسيقاه، يجب إعادة لصق الصوت عند المونتاج. كما سلّم Topaz المعدل المطلوب بدقة تامة، في حين أن RIFE لا يعرف سوى المضاعفة: 24 تصبح 48 أو 72 أو 96، لكن أبدًا 25 أو 30.
أين يفشل فعلًا: وصلة بين لقطتين
عند قطع حاد، يبني الاستيفاء صورة غير موجودة أصلًا: دمج Topaz اللقطتين بتلاشٍ تدريجي، أنتج RIFE دون كشف المشاهد فسيفساء من البكسلات، ولم يترك القطع سليمًا إلا RIFE مع كشف المشاهد.
الحالة المدرسية هي المونتاج. وصلنا لقطتين بقطع حاد، ثانيتان من تحليق فوق قرية ثم ثانيتان من زجاجة عطر، ومررنا الملف عبر المحركين نفسيهما. بين آخر صورة من القرية وأول صورة من الزجاجة، يبحث نموذج الاستيفاء عن حركة غير موجودة، ومع ذلك يتعيّن عليه إنتاج صورة.
أعطى Topaz صورة يظهر فيها الزجاجة شفافًا فوق القرية، أشبه بتلاشٍ تدريجي من صورة واحدة، جزء من ستين من الثانية. أما RIFE، دون أي خيار خاص، فقد أعطى صورة أسوأ بكثير: الزجاجة مقطّعة إلى مربعات عائمة فوق خلفية من البكسلات. وبتفعيل خيار كشف تغيّر المشاهد، تعرّف RIFE على القطع وتركه سليمًا، دون صورة مبتكَرة.
في التشغيل العادي، غالبًا ما تمر صورة شبحية مدتها جزء من ستين من الثانية دون أن يلاحظها أحد. لكن في مونتاج سريع الإيقاع، بقطع كل ثانيتين، تعطي انطباعًا بالاتساخ يصعب تحديده، وتقفز إلى العين عند تفحص الصور واحدة تلو الأخرى. القاعدة بسيطة: يجب استيفاء كل لقطة على حدة، قبل المونتاج، وليس الفيديو النهائي أبدًا.
عيوب أخرى يجب التعرّف عليها
بخلاف القطعات، يرتبك الاستيفاء مع الأجسام المتقاطعة، والأنماط المتكررة، والنصوص المتحركة، والحركات الأسرع من عرض الجسم في كل صورة، والعناصر التي تظهر دفعة واحدة.
الأجسام المتقاطعة، شخصان يتجاوز أحدهما الآخر، يد تمر أمام وجه: يجب على النموذج أن يقرر أي منطقة تعود لأي جسم، والحدود بينهما قد تتموّج. الأنماط المتكررة، شبكة، خطوط، سياج متحرك، تخدعه في التناظر: يُخلط بين عارضة وجارتها فيبدو النمط وكأنه ينزلق في الاتجاه المعاكس.
النصوص المتحركة وواجهات المستخدم فخ آخر: تتشوّه الحروف قليلًا في الصور المبتكَرة، وهو ما يظهر فور القراءة. الحركات السريعة جدًا، جسم ينتقل مسافة أكبر من عرضه بين صورة وأخرى، ليس لها تطابق موثوق: قد يضاعف النموذج الجسم أو يُظهره بتلاشٍ تدريجي. وأخيرًا، كل ما يظهر فجأة بين صورتين، برق، ومضة، شرارة، يُعرض بشكل متلاشٍ بدلًا من الظهور الحاد.
في فيديوهات الذكاء الاصطناعي، كثير من هذه الحالات نادر: فالنماذج تولّد القليل من النصوص المتحركة القابلة للقراءة، وحركتها عمومًا سلسة. اللقطات البانورامية، والدرونات، والوجوه، والمنتجات الدوّارة، والشخصيات الماشية، كلها تمر بسلام. وهي أيضًا اللقطات التي يظهر فيها انخفاض المعدل بوضوح أكبر.
الأدوات، من المجانية إلى الاحترافية
تنقسم الأدوات إلى ثلاث فئات: البرامج المثبَّتة (Topaz Video وDaVinci Resolve وPremiere Pro وFlowframes)، والخدمات عبر الإنترنت (Topaz for Web وCapCut وTensorPix وHitPaw)، وواجهات البرمجة (Runway وfal)؛ والأسعار المرصودة بتاريخ 6 أكتوبر 2026 تتراوح من صفر إلى 299 دولارًا سنويًا.
يُعدّ Topaz Video، المعروف سابقًا باسم Video AI، المرجع المدفوع. يقدّم خمسة نماذج استيفاء: Apollo للحركات غير الخطية والمصادر القليلة الضبابية، Apollo Fast، Chronos لتحويل المعدل والحركة البطيئة، Chronos Fast للحركات الكبيرة، وAion للدقة العالية. يكلّف 299 دولارًا سنويًا أو 59 دولارًا شهريًا، و699 دولارًا سنويًا في الاستخدام التجاري لمن تتجاوز إيراداته مليون دولار. أما نسخته عبر الويب، Topaz for Web، فتستهدف 30 أو 60 أو 90 أو 120 صورة في الثانية مقابل 19 دولارًا شهريًا في العرض الترويجي. ووقّعت Adobe في يونيو 2026 اتفاقية استحواذ على Topaz Labs.
في الجانب المجاني، يُعتبر Flowframes واجهة Windows لنماذج RIFE وDAIN وFLAVR، بترخيص مفتوح المصدر، وتصدر نسخه الأحدث أولًا لداعميه على Patreon. أما RIFE وFILM، وهذا الأخير من إصدار Google، فهما نموذجا بحث قُدِّما عام 2022 ويُستخدَمان عبر سطر الأوامر، كما يقدّم ffmpeg مرشح minterpolate، دون شبكة عصبية. ويوفّر DaVinci Resolve استيفاءً بالتدفق البصري في نسخته المجانية؛ بينما يقتصر وضع Speed Warp على نسخة Studio، بسعر 295 دولارًا. ويقدّم Premiere Pro، بسعر 22.99 دولارًا شهريًا، خاصية Optical Flow ضمن الاستيفاء الزمني. أما SVP، بسعر 24.99 دولارًا مدى الحياة، فيستوفي في الزمن الحقيقي أثناء التشغيل، دون الحاجة إلى تصدير ملف.
عبر الإنترنت، يقدّم CapCut التدفق البصري بمعدل 30 أو 50 أو 60 صورة في الثانية؛ وأبلغ مستخدمون عن انتقال خاصية الحركة البطيئة السلسة فيه إلى الخطة المدفوعة Pro. ويعلن TensorPix عن معدل يصل إلى 120 صورة في الثانية، مع تجربة مجانية مدتها ثلاث دقائق بدقة 720p، فيما يوفّر HitPaw تحويلًا إلى 60 أو 120، ابتداءً من 24.99 دولارًا شهريًا. أما للمطورين، فتحوّل واجهة برمجة تطبيقات Runway إلى 24 أو 25 أو 30 أو 48 أو 50 أو 60 أو 120 صورة في الثانية، وكذلك نسخها 23.98 و29.97 و59.94، مقابل 0.005 دولار للثانية. وفي Imaginode، تعتمد عقدة التحسين على Topaz: 6 أرصدة لكل خمس ثوانٍ بدقة 720p حتى 30 صورة في الثانية، مع الحفاظ على الصوت.
تنعيم الحركة في أجهزة التلفاز
تنعيم الحركة في أجهزة التلفاز هو استيفاء في الزمن الحقيقي للأفلام المصوَّرة بمعدل 24 صورة في الثانية؛ يمنح الأفلام مظهر الفيديو، إلى درجة أن Tom Cruise سجّل في ديسمبر 2018 رسالة يطلب فيها تعطيله، وأن وضع Filmmaker أصبح الآن يُوقِفه تلقائيًا.
تستوفي معظم أجهزة التلفاز الحديثة، افتراضيًا، كل ما تعرضه، لملء شاشتها بمعدل 60 أو 120 هرتز. في الرياضة، هذا تطوّر إيجابي. أما في الأفلام، فهذا ما يُعرف بتأثير المسلسل: تصبح الحركة سلسة إلى درجة يبدو معها المشهد وكأنه صُوِّر بالفيديو، كما في المسلسلات التلفزيونية، ويفقد الرعشة الخفيفة لمعدل 24 صورة التي تميّز السينما. في 4 ديسمبر 2018، نشر Tom Cruise وChristopher McQuarrie فيديو قصيرًا يشرحان فيه أن هذا الإعداد يجعل معظم الأفلام تشبه فيديو عالي السرعة، وكيفية إيقافه.
ردّ اتحاد UHD Alliance بوضع Filmmaker، الذي أُعلن عنه في أغسطس 2019 وأُطلق في معرض CES بيناير 2020، والذي يوقف تنعيم الحركة، وتقليل الضجيج، وزيادة الحدة، ويحترم المعدل الأصلي. أما من جانب البث، فتشترط Netflix تسليم الملفات بمعدلها الأصلي، أي معدل التصوير والمونتاج، وتحذّر من أن تحويلات المعدل غير المتقنة، التي تترك آثارًا مشوِّهة، تُرفَض.
بالنسبة لصانع المحتوى، الدرس مزدوج. لا تستوفِ، بردّ فعل آلي، لقطة روائية يجب أن تحافظ على طابعها السينمائي، واختر المعدل بحسب المكان الذي ستُشاهَد فيه الفيديو. والاختيار بين 24 و25 و30 و60 صورة في الثانية، منصة بمنصة، مفصَّل في 24 أو 25 أو 30 أو 60 إطارًا في الثانية: أي معدل تختار.
الخلاصة
الاستيفاء بالذكاء الاصطناعي موثوق في الحركات المستمرة، اللقطات البانورامية، الدرونات، الشخصيات، حتى السريعة منها عندما يحتوي المصدر على ضبابية حركية؛ ويخطئ في القطعات، والنصوص، والأنماط المتكررة، والأحداث اللحظية.
استوفِ كل لقطة قبل المونتاج، وليس أبدًا فيديو سبق قصّه. إن لم يكن لديك سوى الملف النهائي، استخدم أداة تكشف تغيّرات المشاهد، وتحقق من كل وصلة صورة بصورة.
لمعدل دقيق، 25 أو 30 أو 50 أو 60، تحتاج إلى محرك يستهدف معدلًا محددًا، مثل Topaz؛ فـRIFE لا يعرف سوى المضاعفة باثنين أو ثلاثة أو أربعة. أما للقطة فيها صوت، فاختر محركًا ينسخه، أو خطّط لإعادة لصقه.
في Imaginode، تغيّر عقدة التحسين المعدل عبر Topaz بمعامل ×1، مع الحفاظ على الصوت، مقابل 6 أرصدة لكل خمس ثوانٍ بدقة 720p حتى 30 صورة في الثانية. سير العمل الجاهز للاستخدام هو قالب «تغيير معدل إطارات الفيديو».