كل الأدوات

جعل صورة تتحدث بالذكاء الاصطناعي

صورة وجه ونص تقرؤه صوت من الكتالوج: InfiniTalk يجعل الشخص يتحدث، بما في ذلك حركة الشفتين والرموش وحركات الرأس. مدة الفيديو تساوي مدة الصوت. مسار العمل كاملاً يظهر أمامكم دون حساب.

عرض تفاعلي

سير عمل حقيقي بنتائج حقيقية. تنقّل وكبّر بحرية.

استخدام سير العمل هذا

مسار العمل الحقيقي: صورة في عقدة وسائط، نصان تقرأهما عقدة تعليق صوتي كل واحد على حدة، وعقدتا فيديو مضبوطتان على InfiniTalk تستقبلان الصورة عبر منفذ الصورة والصوت عبر منفذ الصوت.

باختصار

ما ينتجه سير العمل
2 فيديو بمدة 18 ثانية بدقة 480p، بنسبة 1:1 · تعليقان صوتيان
بنية لوحة العمل
8 عقدة مرتبطة بـ 6 وصلة
النماذج الموصولة
ElevenLabs v3, InfiniTalk
تكلفة تشغيل كامل
نحو 446 رصيد، أي ‏5.35 US$

صورة واحدة تكفي. لا حاجة لتصوير فيديو، ولا لضبط شخصية افتراضية: الوجه الموجود في الصورة يبدأ بالتحدث، مع شفتين متزامنتين مع كل مقطع صوتي، ورموش عين، وحركات رأس صغيرة تصاحب الجملة. النتيجة تُشاهد كأنها لقطة مواجهة للكاميرا، وهي في الأصل صورة عادية من الهاتف.

يُقرأ النص في عقدة تعليق صوتي، بأحد أصوات الكتالوج (وفي مقدمتها ElevenLabs v3) أو بصوت مستنسخ. عقدة الفيديو المضبوطة على InfiniTalk تستقبل الصورة والصوت، وتُخرج فيديو تساوي مدته تماماً مدة الصوت، حتى ثمانية وعشرين ثانية. السعر يتبع هذه المدة، المُقاسة على الملف، ويظهر أمامكم قبل الضغط.

هذه هي حركة الشخصية الافتراضية المتحدثة، لكن انطلاقاً من وجهكم أنتم، أو وجه شخصية مولّدة، أو تميمة مرسومة، أو صورة قديمة. رسالة عيد ميلاد، عرض منتج، إعلان على الشبكات الاجتماعية: العرض التجريبي يُظهر رسالتين على الصورة نفسها.

طريقة العمل

  1. 1

    اختاروا صورة من الأمام

    وجه واضح، فم مغلق وظاهر، إضاءة أمامية، خلفية بسيطة. صورة عادية من الهاتف تناسب جيداً. النظارات واللحى مقبولة، لكن اليد أمام الفم أو الوضعية الجانبية لا تصلح.

  2. 2

    اكتبوا النص واختاروا الصوت

    عقدة التعليق الصوتي تقرأ ما تكتبونه بالصوت المختار، بلغتكم. جملة من عشرين كلمة تستغرق سبعاً إلى ثماني ثوانٍ. وَلِّدوا الصوت أولاً: فهو الذي يحدد مدة الفيديو وسعره.

  3. 3

    وَلِّدوا الفيديو

    عقدة InfiniTalk تعرض المدة المقاسة للصوت والسعر الدقيق. اضغطوا: الوجه يتحدث، بدقة 480p للشبكات الاجتماعية أو 720p لعرض على شاشة.

  4. 4

    تابعوا إذا كان النص طويلاً

    بعد ثمانية وعشرين ثانية من الصوت، قسّموا النص إلى لقطتين ورَكِّبوهما بشكل متتابع في عقدة مونتاج، مجاناً، كما في مسارات الفيديو الأخرى.

الأنماط وحالات الاستخدام

لوحة العمل نفسها، مضبوطة لاحتياجات مختلفة: كل نمط يتطلّب تغيير سطرين أو ثلاثة في الـ prompt.

رسالة عيد الميلاد

صورة الشخص المحتفى به، ونص من عشرين كلمة تقرؤه صوت دافئ: هذا هو المثال الثاني في العرض التجريبي. الفيديو يُرسَل كما هو عبر رسالة، ولم يكن على أحد أن يصور نفسه.

عرض المنتج دون تصوير

صورة شخصية مولّدة تتحول إلى مقدِّم: نص الإطلاق في عقدة التعليق الصوتي، والصورة في عقدة الوسائط، ويخرج الفيديو بدقة 720p، جاهزاً لصفحة منتج أو إعلان محتوى مستخدمين.

صورة قديمة تروي قصتها

صورة عائلية ممسوحة رقمياً، ونص مكتوب بصيغة المتحدث: الوجه يحيا ويتحدث. مرّروا الصورة أولاً في عقدة تحسين إذا كانت صغيرة أو تالفة، ثم في InfiniTalk.

التميمة التي تُعلن

شخصية مرسومة بفم واضح تعمل جيداً: النموذج يُحرِّك شفتي الرسم كما يفعل مع صورة حقيقية. مثالي لإعلان علامة تجارية على الشبكات الاجتماعية، بصوت مرح من الكتالوج.

نفس الرسالة بثلاث لغات

صورة واحدة، وثلاث عقد تعليق صوتي بثلاث لغات، وثلاث عقد InfiniTalk: نفس الشخص يتحدث الإنجليزية والإسبانية والفرنسية، مع شفتين دقيقتين في كل مرة. وللانطلاق من فيديو مصوَّر مسبقاً، انظروا الدبلجة.

الصورة التي تتحدث، ثم تتحرك

خذوا الفيديو المُنتج ومرّروه في جعل صورة ترقص أو في عقدة فيديو كمرجع: الكلام أولاً، ثم حركة الجسم.

أخطاء شائعة

وجه من الجانب أو زاوية ثلاثة أرباع ضيقة

النموذج يحتاج إلى رؤية الفم كاملاً. من الأمام أو بزاوية ثلاثة أرباع خفيفة، التزامن يكون نظيفاً؛ من الجانب، تتشوه الشفتان.

فم مفتوح أو مخفي في الصورة

ابتسامة تُظهر الأسنان، يد على الذقن، ميكروفون أمام الفم: كل هذه عوائق. فم مغلق ووجه واضح، والنتيجة تكون دقيقة.

كتابة النص في عقدة الفيديو

موجّه عقدة InfiniTalk يصف السلوك، لا النص. ما يقوله الشخص هو الصوت المربوط: النص يُكتب في عقدة التعليق الصوتي.

صوت طويل جداً لتمريرة واحدة

بعد ثمانٍ وعشرين ثانية، ترفض العقدة التوليد دون خصم أي مبلغ. قسّموا إلى لقطتين وتابعوهما في عقدة مونتاج.

النماذج المقترحة

أسئلة شائعة

كم من الوقت يمكن للصورة أن تتحدث؟

من ثانيتين إلى ثمانٍ وعشرين ثانية في كل توليد، أي حوالي سبعين كلمة بمعدل عادي. الفيديو تساوي مدته تماماً مدة الصوت المربوط: لا شيء يُضبط.

هل يمكنني استخدام صوتي الخاص؟

نعم. استوردوا تسجيلاً في عقدة وسائط وصِلوه بمنفذ الصوت، أو استنسخوا صوتكم في عقدة التعليق الصوتي واجعلوه يقرأ أي نص.

هل أحتاج إلى صورة لي، أم تصلح شخصية مولّدة؟

كلاهما يصلح. صورة شخصية مولّدة بعقدة صورة، أو تميمة مرسومة، أو صورة قديمة، كلها تتحدث بنفس جودة صورة سيلفي، ما دام الوجه من الأمام والفم ظاهراً.

هل يُحاسَب المبلغ إذا فشل التوليد؟

لا. يُحجز السعر عند البدء ويُرد تلقائياً في حال فشل تقني. المبلغ الدقيق يظهر على الزر قبل الضغط.

ما الفرق مع الشخصية الافتراضية المتحدثة؟

الشخصية الافتراضية المتحدثة تُولِّد مقدِّماً خيالياً بصوته، في مرة واحدة، على Veo. أما هنا، فصورتكم أنتم هي التي تتحدث، بالصوت الذي تختارونه، ويتغير النص دون إعادة توليد الشخصية.

هل يمكن اختيار اللغة؟

نعم، في عقدة التعليق الصوتي: أصوات ElevenLabs تقرأ أربع عشرة لغة. تزامن الشفتين يتبع الأصوات، بغض النظر عن اللغة.

هل الفيديو بصيغة 16:9 أم عمودي؟

InfiniTalk يُخرج إطاراً قريباً من الصورة، بدقة 480p أو 720p. للحصول على تنسيق دقيق، أعيدوا القص بعد ذلك في عقدة مونتاج، التي تقبل 9:16 و1:1 و16:9.

هل يمكنني جعل عدة أشخاص يتحدثون؟

شخص واحد في كل عقدة. للحصول على محادثة، اجعلوا صورتين تتحدثان كل واحدة بصوتها، ثم تناوبوا اللقطات في عقدة مونتاج.

جعل صورة تتحدث بالذكاء الاصطناعي

استخدام سير العمل هذا

حساب مجاني، دون بطاقة بنكية. يُفتح سير العمل معبّأً مسبقًا في لوحة عملك.