رسالة عيد الميلاد
صورة الشخص المحتفى به، ونص من عشرين كلمة تقرؤه صوت دافئ: هذا هو المثال الثاني في العرض التجريبي. الفيديو يُرسَل كما هو عبر رسالة، ولم يكن على أحد أن يصور نفسه.
صورة وجه ونص تقرؤه صوت من الكتالوج: InfiniTalk يجعل الشخص يتحدث، بما في ذلك حركة الشفتين والرموش وحركات الرأس. مدة الفيديو تساوي مدة الصوت. مسار العمل كاملاً يظهر أمامكم دون حساب.
سير عمل حقيقي بنتائج حقيقية. تنقّل وكبّر بحرية.
استخدام سير العمل هذامسار العمل الحقيقي: صورة في عقدة وسائط، نصان تقرأهما عقدة تعليق صوتي كل واحد على حدة، وعقدتا فيديو مضبوطتان على InfiniTalk تستقبلان الصورة عبر منفذ الصورة والصوت عبر منفذ الصوت.
باختصار
صورة واحدة تكفي. لا حاجة لتصوير فيديو، ولا لضبط شخصية افتراضية: الوجه الموجود في الصورة يبدأ بالتحدث، مع شفتين متزامنتين مع كل مقطع صوتي، ورموش عين، وحركات رأس صغيرة تصاحب الجملة. النتيجة تُشاهد كأنها لقطة مواجهة للكاميرا، وهي في الأصل صورة عادية من الهاتف.
يُقرأ النص في عقدة تعليق صوتي، بأحد أصوات الكتالوج (وفي مقدمتها ElevenLabs v3) أو بصوت مستنسخ. عقدة الفيديو المضبوطة على InfiniTalk تستقبل الصورة والصوت، وتُخرج فيديو تساوي مدته تماماً مدة الصوت، حتى ثمانية وعشرين ثانية. السعر يتبع هذه المدة، المُقاسة على الملف، ويظهر أمامكم قبل الضغط.
هذه هي حركة الشخصية الافتراضية المتحدثة، لكن انطلاقاً من وجهكم أنتم، أو وجه شخصية مولّدة، أو تميمة مرسومة، أو صورة قديمة. رسالة عيد ميلاد، عرض منتج، إعلان على الشبكات الاجتماعية: العرض التجريبي يُظهر رسالتين على الصورة نفسها.
اختاروا صورة من الأمام
وجه واضح، فم مغلق وظاهر، إضاءة أمامية، خلفية بسيطة. صورة عادية من الهاتف تناسب جيداً. النظارات واللحى مقبولة، لكن اليد أمام الفم أو الوضعية الجانبية لا تصلح.
اكتبوا النص واختاروا الصوت
عقدة التعليق الصوتي تقرأ ما تكتبونه بالصوت المختار، بلغتكم. جملة من عشرين كلمة تستغرق سبعاً إلى ثماني ثوانٍ. وَلِّدوا الصوت أولاً: فهو الذي يحدد مدة الفيديو وسعره.
وَلِّدوا الفيديو
عقدة InfiniTalk تعرض المدة المقاسة للصوت والسعر الدقيق. اضغطوا: الوجه يتحدث، بدقة 480p للشبكات الاجتماعية أو 720p لعرض على شاشة.
تابعوا إذا كان النص طويلاً
بعد ثمانية وعشرين ثانية من الصوت، قسّموا النص إلى لقطتين ورَكِّبوهما بشكل متتابع في عقدة مونتاج، مجاناً، كما في مسارات الفيديو الأخرى.
لوحة العمل نفسها، مضبوطة لاحتياجات مختلفة: كل نمط يتطلّب تغيير سطرين أو ثلاثة في الـ prompt.
صورة الشخص المحتفى به، ونص من عشرين كلمة تقرؤه صوت دافئ: هذا هو المثال الثاني في العرض التجريبي. الفيديو يُرسَل كما هو عبر رسالة، ولم يكن على أحد أن يصور نفسه.
صورة شخصية مولّدة تتحول إلى مقدِّم: نص الإطلاق في عقدة التعليق الصوتي، والصورة في عقدة الوسائط، ويخرج الفيديو بدقة 720p، جاهزاً لصفحة منتج أو إعلان محتوى مستخدمين.
صورة عائلية ممسوحة رقمياً، ونص مكتوب بصيغة المتحدث: الوجه يحيا ويتحدث. مرّروا الصورة أولاً في عقدة تحسين إذا كانت صغيرة أو تالفة، ثم في InfiniTalk.
شخصية مرسومة بفم واضح تعمل جيداً: النموذج يُحرِّك شفتي الرسم كما يفعل مع صورة حقيقية. مثالي لإعلان علامة تجارية على الشبكات الاجتماعية، بصوت مرح من الكتالوج.
صورة واحدة، وثلاث عقد تعليق صوتي بثلاث لغات، وثلاث عقد InfiniTalk: نفس الشخص يتحدث الإنجليزية والإسبانية والفرنسية، مع شفتين دقيقتين في كل مرة. وللانطلاق من فيديو مصوَّر مسبقاً، انظروا الدبلجة.
خذوا الفيديو المُنتج ومرّروه في جعل صورة ترقص أو في عقدة فيديو كمرجع: الكلام أولاً، ثم حركة الجسم.
النموذج يحتاج إلى رؤية الفم كاملاً. من الأمام أو بزاوية ثلاثة أرباع خفيفة، التزامن يكون نظيفاً؛ من الجانب، تتشوه الشفتان.
ابتسامة تُظهر الأسنان، يد على الذقن، ميكروفون أمام الفم: كل هذه عوائق. فم مغلق ووجه واضح، والنتيجة تكون دقيقة.
موجّه عقدة InfiniTalk يصف السلوك، لا النص. ما يقوله الشخص هو الصوت المربوط: النص يُكتب في عقدة التعليق الصوتي.
بعد ثمانٍ وعشرين ثانية، ترفض العقدة التوليد دون خصم أي مبلغ. قسّموا إلى لقطتين وتابعوهما في عقدة مونتاج.
من ثانيتين إلى ثمانٍ وعشرين ثانية في كل توليد، أي حوالي سبعين كلمة بمعدل عادي. الفيديو تساوي مدته تماماً مدة الصوت المربوط: لا شيء يُضبط.
نعم. استوردوا تسجيلاً في عقدة وسائط وصِلوه بمنفذ الصوت، أو استنسخوا صوتكم في عقدة التعليق الصوتي واجعلوه يقرأ أي نص.
كلاهما يصلح. صورة شخصية مولّدة بعقدة صورة، أو تميمة مرسومة، أو صورة قديمة، كلها تتحدث بنفس جودة صورة سيلفي، ما دام الوجه من الأمام والفم ظاهراً.
لا. يُحجز السعر عند البدء ويُرد تلقائياً في حال فشل تقني. المبلغ الدقيق يظهر على الزر قبل الضغط.
الشخصية الافتراضية المتحدثة تُولِّد مقدِّماً خيالياً بصوته، في مرة واحدة، على Veo. أما هنا، فصورتكم أنتم هي التي تتحدث، بالصوت الذي تختارونه، ويتغير النص دون إعادة توليد الشخصية.
نعم، في عقدة التعليق الصوتي: أصوات ElevenLabs تقرأ أربع عشرة لغة. تزامن الشفتين يتبع الأصوات، بغض النظر عن اللغة.
InfiniTalk يُخرج إطاراً قريباً من الصورة، بدقة 480p أو 720p. للحصول على تنسيق دقيق، أعيدوا القص بعد ذلك في عقدة مونتاج، التي تقبل 9:16 و1:1 و16:9.
شخص واحد في كل عقدة. للحصول على محادثة، اجعلوا صورتين تتحدثان كل واحدة بصوتها، ثم تناوبوا اللقطات في عقدة مونتاج.
جعل صورة تتحدث بالذكاء الاصطناعي
استخدام سير العمل هذاحساب مجاني، دون بطاقة بنكية. يُفتح سير العمل معبّأً مسبقًا في لوحة عملك.