المدوّنة

5 سبتمبر 2026

فيديو ذكاء اصطناعي أطول من 10 ثوانٍ: المدد الحقيقية لكل نموذج والطريقة التي تكلّف النصف

إلى أي حد يذهب كل نموذج فيديو فعلًا، ولماذا يكلّف توليد ثلاثين ثانية ستة أضعاف توليد خمس، وكيف تركّب فيلمًا من دقيقة بتسلسل لقطات قصيرة مع مونتاج مجاني.

Frank Houbre

Frank Houbreمؤسس Imaginode

الحد الذي يكتشفه الجميع في أول فيديو

معظم نماذج الفيديو تتوقف بين 5 و10 ثوانٍ، وبعضها يصل إلى 15، وثلاثة فقط تبلغ 30 ثانية في توليد واحد.

لقد ولّدت لتوّك أول لقطة لك. جميلة، والحركة تعمل، والإضاءة حاضرة. ومدتها خمس ثوانٍ. تبحث عن المؤشر الذي يرفعها إلى دقيقة، ولا وجود له.

هذه أول خيبة لكل من يصل إلى فيديو الذكاء الاصطناعي، وهي مشروعة: يبيعوننا أفلامًا ويسلّموننا لقطات. غير أن القيد ليس ما نظنّه، والحل ليس تقنيًا في شيء. عمره مئة عام واسمه المونتاج.

سننظر في هذا معًا، مع المدد الدقيقة لكل نموذج في الكتالوج، والأسعار الحقيقية بالنقاط، وقبل ذلك المقارنة الموجعة: كم تكلّف دقيقة فيديو في توليد واحد مقابل الدقيقة نفسها مقطّعة إلى لقطات. الفارق سيفاجئك.

المدد الحقيقية، نموذجًا بنموذج

Wan 3.0 وWan 3.0 Prime وSeedance 2.5 تصل إلى 30 ثانية، وFlux 3 Video إلى 20، وKling V3 وSeedance 2.0 وWan 2.7 وGrok Imagine إلى 15، بينما يتوقف Veo 3.1 عند 8 ثوانٍ.

إليك حال الكتالوج، لأن هذه السقوف ليست مكتوبة في أي مكان آخر بشكل مقروء. الأطول أولًا: Wan 3.0 وَWan 3.0 Prime يقبلان من 2 إلى 30 ثانية، وSeedance 2.5 من 4 إلى 30. وهي الثلاثة الوحيدة التي تبلغ نصف الدقيقة.

تحتها مباشرة، Flux 3 Video من 5 إلى 20 ثانية. ثم مجموعة الخمس عشرة: Kling V3 من 3 إلى 15، وSeedance 2.0 وَSeedance 2.0 Fast من 4 إلى 15، وWan 2.7 من 2 إلى 15، وGrok Imagine Video من 1 إلى 15.

والقصيرة، وهي غالبًا الأفضل: Kling 2.5 Turbo يقترح 5 أو 10 ثوانٍ، بلا قيمة وسطى. وVeo 3.1 Lite وَVeo 3.1 Fast يتيحان الاختيار بين 4 و6 و8 ثوانٍ، ولا ثانية أكثر. الكتالوج الكامل في صفحة النماذج، مع السعر الذي يتحرك مباشرةً حسب إعداداتك.

لماذا تتوقف النماذج بهذه السرعة

كلفة الحساب ترتفع مع المدة والاتساق يتدهور: بعد ثوانٍ قليلة يفقد النموذج خيط مشهده نفسه.

سببان، اقتصادي وتقني. الاقتصادي بسيط: توليد الفيديو يعني إنتاج أربع وعشرين صورة في الثانية يجب أن تتماسك كلها معًا. الحساب يرتفع بسرعة، والموردون يحاسبون بالثانية لأن هذا ما يكلّفهم.

التقني أكثر إثارة. يحافظ نموذج الفيديو على اتساقه ضمن نافذة محدودة. بعد وقت معيّن، تتحوّل الوجوه ببطء، وتغيّر الملابس لونها، ويختفي غرض موضوع على الطاولة. لا شك أنك رأيت فيديو ذكاء اصطناعي من عشرين ثانية ينحرف فيه شيء ببطء من دون أن تعرف ما هو.

اعلم أن سقف الخمس أو العشر ثوانٍ ليس تضييقًا تجاريًا. هو غالبًا المنطقة التي يكون فيها النموذج جيدًا فعلًا. وما بعدها تدفع أكثر مقابل نتيجة أقل تماسكًا، وهذا أسوأ ما في العالمين.

سعر التوليد الطويل: المفاجأة السيئة

الفوترة تتناسب مع الثانية: ثلاثون ثانية تكلّف بالضبط ستة أضعاف خمس ثوانٍ، بلا أي خصم كمية.

هذه هي النقطة التي يكتشفها الناس بعد فوات الأوان، وهي الموضوع الحقيقي لهذا المقال. لدى معظم النماذج، التعرفة بالتناسب مع المدة. لا تدرّج، ولا اشتراك مقطوع، ولا سعر جملة.

الأرقام الدقيقة، على Wan 3.0. خمس ثوانٍ بدقة 720p تكلّف 60 نقطة. عشر ثوانٍ بدقة 1080p، 240 نقطة. وثلاثون ثانية بدقة 1080p، 720 نقطة، أي نحو 7 يورو لنصف دقيقة. بدقة 720p، ينزل نصف الدقيقة نفسه إلى 360 نقطة، وبدقة 480p إلى 180.

وعند Seedance 2.5، تكلّف ثلاثون ثانية بدقة 720p أيضًا 720 نقطة، مقابل 240 لعشر ثوانٍ. ويطلب Flux 3 Video 696 نقطة مقابل عشريناته بدقة 1080p. وKling V3 عند 303 نقاط لعشر ثوانٍ بدقة 1080p. بهذه التعرفة، يكفي توليد واحد فاشل على لقطة من ثلاثين ثانية لتكون قد رميت سبعة يوروهات من النافذة.

المقارنة الحاسمة: ثلاثون ثانية، طريقتان

ستّ لقطات من خمس ثوانٍ عند Kling 2.5 Turbo تكلّف 156 نقطة مقابل 360 لتوليد واحد من ثلاثين ثانية بدقة 720p: أقل من النصف، ونتيجة أقبل للمشاهدة.

لنأخذ فيلمًا من ثلاثين ثانية ونحسب بالطريقتين. الطريقة الأولى، التوليد الواحد: Wan 3.0، ثلاثون ثانية، 720p، 360 نقطة. نقرة واحدة، انتظار واحد، ولقطة متصلة من ثلاثين ثانية.

الطريقة الثانية، ستّ لقطات من خمس ثوانٍ عند Kling 2.5 Turbo بدقة 720p، بـ26 نقطة للواحدة. المجموع: 156 نقطة. ومع Seedance 2.0 Fast بـ48 نقطة للخمس ثوانٍ نصعد إلى 288 نقطة، ولا نزال تحت. والمونتاج الذي يجمع كل شيء لا يكلّف شيئًا، وسنصل إليه.

لكن السعر ليس حتى الحجة الأساسية. مع ستّ لقطات، تفشل لقطة فتعيد إطلاقها وحدها بـ26 نقطة. ومع توليد واحد، تفشل الثانية الثانية والعشرون فتعيد دفع الثلاثين كلها. هذا اللاتماثل هو ما يهمّ حين نعمل حقًا، لا التوفير الأولي.

ما يفعله السينمائيون منذ مئة عام

متوسط طول اللقطة في فيلم حديث يدور حول ثوانٍ قليلة: لا أحد يشاهد ثلاثين ثانية من لقطة ثابتة، والذكاء الاصطناعي يجبرك ببساطة على احترام هذه القواعد.

انظر إلى أي إعلان، أي مقطع دعائي، أي فيديو كليب. عُدّ اللقطات. في ثلاثين ثانية من إعلان ستجد غالبًا عشرًا منها. اللقطة الطويلة موجودة، وهي رائعة، ونادرة، ومحجوزة للحظات محددة.

الفيديو الذي يبقى في الذاكرة ليس صورة جميلة تدوم، بل انفعالًا يتطوّر. والانفعال يتطوّر بالقطع: نُظهر الوجه، ثم ما ينظر إليه، ثم اليد المرتعشة. ثلاث لقطات من ثلاث ثوانٍ تروي أضعاف ما ترويه تسع ثوانٍ ثابتة على الإطار نفسه.

نعم، قيد النماذج مفروض في البداية. لكنه يدفعك بالضبط إلى حيث كان ينبغي أن تذهب. من ينتجون أفضل فيديوهات الذكاء الاصطناعي اليوم لا يبحثون عن لقطة الثلاثين ثانية، بل يتابعون لقطات من خمس.

عقدة المونتاج، وكونها لا تكلّف شيئًا

المونتاج يجمع المقاطع ويقصّها ويضيف قطعات أو مزجًا ومسارًا صوتيًا، والتصدير يُحسب على جهازك من دون استهلاك أي نقطة.

هذه هي العقدة التي تغيّر واقع هذا المقال كله. توصل عقد الفيديو بمنفذ المقاطع فيها، أو تختار مباشرةً من وسائط المشروع، فتحصل على خط زمني. كل مقطع يُقصّ ببداية ونهاية. وبين مقطعين تختار قطعًا حادًا أو مزجًا متسلسلًا أو انتقالًا إلى الأسود.

وهي تقبل أيضًا صورًا ثابتة بمدة قابلة للضبط، ما يتيح إدراج بطاقة عنوان أو صورة منتج بين لقطتين متحركتين. وتحمل مسارات صوتية منفصلة، لكل مسار إزاحته ومستوى صوته: تعليقك الصوتي في جهة والموسيقى في أخرى.

النقطة المهمة: التصدير مجاني. الحساب يجري في متصفحك، على جهازك، ولا تُخصم أي نقطة. يمكنك إذن إعادة مونتاج فيلمك خمس عشرة مرة، وتجربة ثلاثة ترتيبات للقطات، وتغيير انتقال، من دون أن يكلّفك ذلك شيئًا. فقط أبقِ التبويب مفتوحًا أثناء التصدير.

الطريقة الكاملة، من خطة العمل إلى التصدير

قطّع أولًا إلى لقطات، وصادِق على كل لقطة بصورة ثابتة بنقاط قليلة، ولا تولّد الفيديو إلا على الصور المصادَق عليها، ثم اجمع.

المرحلة الأولى، على الورق أو في عقدة نصّ: قطّع ثلاثينك إلى لقطات. ستّ لقطات من خمس، أو ثماني لقطات من ثلاث إلى خمس. اكتب ما تُظهره كل واحدة. هذا ما يسمى التقطيع، ويأخذ عشر دقائق.

المرحلة الثانية، وهي الأكثر توفيرًا: صادِق على كل لقطة بصورة ثابتة قبل دفع ثمن الفيديو. صورة Flux 2 Klein تكلّف 3 نقاط، ولقطة فيديو تكلّف من 26 إلى 96. تضبط التأطير، وتعدّل الإضاءة، وتصادق على الشخصية، كل ذلك بسعر الصورة. فصّلت هذه الطريقة في اللوحة القصصية بالذكاء الاصطناعي قبل التصوير.

المرحلة الثالثة: تصير كل صورة مصادق عليها صورةَ البداية لعقدة فيديو. يحرّك النموذج ما وافقت عليه سلفًا بدل أن يخترع إطارًا. المرحلة الرابعة: كل شيء يذهب إلى المونتاج. في هذه المرحلة يكون جوهر العمل الإبداعي قد أُنجز.

الحفاظ على الاستمرارية من لقطة إلى أخرى

عقدة مرجع للشخصية وعقدة أسلوب موصولة بكل اللقطات تكفيان لتنتمي المقاطع الستّة إلى الفيلم نفسه.

الخطر الحقيقي للمونتاج باللقطات هو ألا يشبه فيلمًا بل ستة فيديوهات مختلفة ملصوقة. تتغيّر ملامح الشخصية، وتقفز الإضاءة، ولا تتطابق الحبيبات. هنا يصير الكانفاس مفيدًا لا جميلًا فحسب.

عقدة المرجع تمسك الشخصية: تعطيها ثلاث صور واسمًا، ثم تستدعيها بـ@ذِكر في كل موجّه من موجّهاتك الستّة. الموضوع معالَج بالتفصيل في شخصية متّسقة بالذكاء الاصطناعي، وهو اللبنة الأهم إن ظهر إنسان في أكثر من لقطة.

عقدة أسلوب موصولة بالعقد الستّ تمسك الإدارة الفنية: اللوحة اللونية نفسها، والمادة نفسها، ومعالجة الضوء نفسها في كل مكان. وعقدة كاميرا مشتركة تحافظ على اتساق العدسة والفتحة. ثلاث عقد لستّ لقطات، تُوصل مرة واحدة.

صورة النهاية: وصل لقطتين بلا قطع مرئي

عدة نماذج تقبل صورة نهاية إضافة إلى صورة البداية: فتستطيع اللقطة التالية أن تبدأ بالضبط حيث توقّفت السابقة.

ثمة حيلة للحظات التي تريد فيها استمرارية حقيقية بدل قطع. بعض النماذج تتعامل مع صورة نهاية، إضافة إلى صورة البداية: تعطيها البداية والوصول، فتصنع الطريق بينهما.

في الكتالوج، يقبل صورة النهاية كل من Seedance 2.0 وSeedance 2.0 Fast وSeedance 2.5 وKling V3 وWan 3.0 وWan 3.0 Prime وMiniMax H3 وVeo 3.1 Fast. يظهر المنفذ تلقائيًا على العقدة حين يكون النموذج المختار قادرًا، فلا داعي للبحث عن إعداد خفيّ.

التقنية الناتجة: خذ آخر صورة من لقطتك الأولى واجعلها صورة البداية للقطة الثانية. تحصل على مقطعين من خمس ثوانٍ يتتابعان بلا انقطاع، بسعر مقطعين قصيرين. هكذا تُصنع حركة من عشرين ثانية تصمد.

الصوت: مسار واحد لا ستة

توليد الصوت على كل لقطة ينتج ستّ أجواء تتناقض في المونتاج: الأفضل لقطات صامتة ومسار صوتي واحد فوق المجموع.

فخّ كلاسيكي، ويكلّف مرتين. كثير من النماذج تقترح مفتاح صوت، وغالبًا ما يكون مفعّلًا افتراضيًا لأن الفيديو الصامت يُلاحظ فورًا. على لقطة منفردة، هذا ممتاز.

أما على ستّ لقطات ستُركَّب، فهي فكرة سيئة. كل توليد يخترع جوّه الخاص، وفي المونتاج تسمع ستّ غرف مختلفة تتقاطع بعنف. والصوت يُدفع ثمنه: عند Veo 3.1 Lite، ثماني ثوانٍ بدقة 720p تكلّف 29 نقطة بلا صوت و48 مع صوت. ست مرات تعني فارق 114 نقطة مقابل نتيجة غير صالحة.

ولّد صامتًا، ثم ضع الصوت على المونتاج الكامل. تعليق صوتي، وموسيقى، وبعض المؤثرات الصوتية موضوعة في الأماكن المناسبة على مسارات عقدة المونتاج، بإزاحتها ومستواها. يكسب الفيلم وحدة لن تنالها أبدًا لقطات صُوِّتت كلٌّ على حدة.

متى يبرَّر التوليد الطويل رغم ذلك

تحتفظ اللقطة المتصلة بقيمتها في حركة متواصلة لا يمكن قطعها، أو ترافلينغ، أو تحوّل تدريجي، وهناك يجب قبول الثمن.

لن أقول لك إن التوليد الطويل لا ينفع أبدًا، فذلك غير أمين. هناك حالات يكون فيها الجواب الوحيد. ترافلينغ متواصل داخل ديكور، تحوّل يجب أن يُرى بلا انقطاع، رقصة، لقطة يهدم القطعُ فيها الأثر نفسه.

في هذه الحالات، خذ Wan 3.0 أو Seedance 2.5 واقبل التعرفة. لكن افعل ذلك عن معرفة: صادِق على التأطير بالصورة أولًا، وأنزل الدقة أثناء تجاربك، ولا ترفع إلى 1080p إلا على النسخة التي تعرف أنها جيدة. ثلاثون ثانية بدقة 480p تكلّف 180 نقطة عند Wan 3.0 مقابل 720 بدقة 1080p، ولمصادقة حركة تكفي 480p وتزيد.

وبالمناسبة، هذا هو منطق بقية الكتالوج أيضًا: استكشف بالسعر الأدنى، وأنهِ بالسعر الأعلى. تفصيل هذه الحسبة في كم تكلّف فعلًا صورة أو فيديو بالذكاء الاصطناعي، والحاسبة العامة تتيح لك محاكاة فيلمك قبل إنفاق نقطة واحدة.

ما ينبغي تذكّره

ثلاثون ثانية بلقطات قصيرة تكلّف أقل من نصف توليد واحد، وتُصحَّح لقطةً بلقطة، وتُركَّب مجانًا.

السقوف الحقيقية: 30 ثانية عند Wan 3.0 وWan 3.0 Prime وSeedance 2.5، و20 عند Flux 3 Video، و15 عند Kling V3 وSeedance 2.0 وWan 2.7 وGrok، و8 عند Veo 3.1. لن يعطيك أي نموذج دقيقة دفعة واحدة، وهذا جيد جدًا.

الطريقة التي تنجح: التقطيع، والمصادقة بالصورة، وتوليد لقطات من خمس ثوانٍ، وضبط الاتساق بعقدة مرجع وعقدة أسلوب، والوصل بصور النهاية حين تتطلّب الاستمرارية ذلك، ثم المونتاج والتصويت دفعة واحدة. وبما أن المونتاج مجاني، فالكلفة الوحيدة هي كلفة اللقطات.

لتجربة أولى، خذ أول فيديو لك بالذكاء الاصطناعي إن لم تولّد من قبل، ثم عد لتصنع فيلمًا من ثلاثين ثانية في ستّ لقطات. احسب نحو 156 نقطة عند Kling 2.5 Turbo، أي نحو يورو ونصف، بما في ذلك المونتاج.

هل تريد التجربة على لوحة عمل حقيقية؟

كل ما ورد في هذا المقال يتم على Imaginode، من متصفحك مباشرة.

ابدأ الآن