पाँच भाषाओं में विज्ञापन
फ़्रेंच में शूट किया गया एक विज्ञापन पाँच फ़ाइलों में बदल जाता है: हर भाषा के लिए एक Voice-over node, हर भाषा के लिए एक Sync Lipsync 3 node, इनपुट में वही वीडियो। बजट लॉन्च करने से पहले हर बटन पर दिखता है।
किसी वीडियो में कोई बोल रहा है, और उसे एक नई भाषा में नई आवाज़ चाहिए: Sync Lipsync 3 होंठों को नए टेक्स्ट के अनुसार फिर से टाइम करता है। वही शॉट अंग्रेज़ी में और स्पैनिश में, बिना फिर से शूट किए। पूरा वर्कफ़्लो बिना अकाउंट के देखा जा सकता है।
असली वर्कफ़्लो, असली नतीजे। खुलकर घुमाइए और ज़ूम कीजिए।
यह वर्कफ़्लो इस्तेमाल करेंअसली वर्कफ़्लो: avatar का वीडियो एक Media node में, दो अनुवाद, हर एक को अलग Voice-over node द्वारा पढ़ा गया, और दो Video node जो Sync Lipsync 3 पर सेट हैं और video port से वीडियो तथा voice port से आवाज़ लेते हैं।
एक नज़र में
एक बार शूट किया गया वीडियो, जितनी भाषाओं में चाहिए उतनी में उपलब्ध: यही होंठ-सिंक डबिंग करती है। स्क्रीन पर मौजूद व्यक्ति अब मूल वाक्य नहीं बोलता, वह अनुवाद बोलता है, और उसका मुँह फ्रेम दर फ्रेम नई आवाज़ के अनुसार चलता है। चेहरा, रोशनी, फ्रेमिंग शूट वाली ही रहती है।
अनुवादित टेक्स्ट को एक Voice-over node में पढ़ा जाता है, किसी कैटलॉग वॉइस से या क्लोन की गई आवाज़ से, जैसे आपकी अपनी। Sync Lipsync 3 पर सेट किया गया Video node वीडियो और आवाज़ दोनों प्राप्त करता है, और डब किया गया शॉट रेंडर करता है। कीमत बनाई गई अवधि पर निर्भर करती है, जो आपकी दोनों फ़ाइलों पर मापी जाती है, और क्लिक करने से पहले ही दिख जाती है।
डेमो बात करते avatar के वीडियो से शुरू होता है, जो फ़्रेंच में है, और उसे अंग्रेज़ी में फिर स्पैनिश में रेंडर करता है। एक विज्ञापन, एक इंटरनल ट्रेनिंग वीडियो, एक प्रोडक्ट प्रेज़ेंटेशन: एक ही शूट, हर मार्केट के लिए एक फ़ाइल।
बोलती वीडियो अपलोड करें
सामने से दिखता चेहरा, अच्छी रोशनी में, मुँह साफ़ दिखता हुआ, सामने कोई हाथ या माइक्रोफ़ोन नहीं। हर पास में अधिकतम दो मिनट। फ़ोन से लिया गया शॉट भी चलेगा।
अनुवाद लिखें और आवाज़ चुनें
हर Voice-over node एक भाषा में एक टेक्स्ट पढ़ता है। व्यक्ति के करीब की आवाज़ चुनें, या उनकी आवाज़ को क्लोन करें ताकि हर भाषा में उनका टिम्बर बना रहे।
दोनों अवधियों का मिलान सेट करें
डिफ़ॉल्ट रूप से, नतीजा दोनों में से छोटी अवधि पर रुक जाता है। यदि आवाज़ शॉट से ज़्यादा लंबी है, तो “लूप” चुनें: वीडियो आवाज़ के नीचे दोहराता है, जो कैमरे के सामने वाले शॉट पर अच्छा लगता है।
जनरेट करें और तुलना करें
हर भाषा के लिए एक node, सभी एक ही वीडियो से जुड़े। हर एक की कीमत उसकी अवधि पर निर्भर करती है। जो भाषा पसंद न आए, केवल उसे ही फिर से चलाएँ।
वही कैनवास, अलग-अलग ज़रूरतों के लिए सेट किया हुआ: हर वेरिएंट में प्रॉम्प्ट की बस दो-तीन लाइनें बदलनी होती हैं।
फ़्रेंच में शूट किया गया एक विज्ञापन पाँच फ़ाइलों में बदल जाता है: हर भाषा के लिए एक Voice-over node, हर भाषा के लिए एक Sync Lipsync 3 node, इनपुट में वही वीडियो। बजट लॉन्च करने से पहले हर बटन पर दिखता है।
कैमरे के सामने फ़िल्माया गया एक ट्रेनर, एक Text node से अनुवादित टेक्स्ट, एक Voice-over node द्वारा पढ़ा गया, और विदेश की टीमों के लिए डब की गई वीडियो। एडिट वही रहता है।
डबिंग एक ही भाषा में भी काम आती है: कोई वाक्य गलत बोला गया, कोई कीमत बदल गई, कोई नाम सुधारना है। टेक्स्ट फिर लिखें, फिर से चलाएँ, मुँह उसके साथ चलता है।
एक असली गवाही व्यक्ति का चेहरा खोए बिना विदेशी दर्शकों तक पहुँच सकती है: उसे किसी करीबी आवाज़ से डब करें, और एक्सेसिबिलिटी के लिए सबटाइटल रखे रहने दें।
बात करते avatar या UGC विज्ञापन से बनाई गई वीडियो से शुरू करें, और उसे डब करें: सिंथेटिक कैरेक्टर शॉट को फिर से जनरेट किए बिना हर भाषा बोलता है।
यदि आपके पास शुरुआती वीडियो नहीं है, तो किसी फ़ोटो को बोलते दिखाएँ: InfiniTalk एक पोर्ट्रेट और एक आवाज़ से चेहरे की गतिविधि बनाता है।
यह मॉडल एक चेहरे को सिंक करता है। स्क्रीन पर दो लोग होने पर नतीजा अनिश्चित होता है। बोलने वाले व्यक्ति पर फ्रेम करें।
कट मोड में, नतीजा वीडियो के साथ रुक जाता है और टेक्स्ट का अंत गायब हो जाता है। अनुवाद छोटा करें या लूप मोड पर जाएँ।
हाथ, माइक्रोफ़ोन, कप: मुँह के सामने से गुज़रने वाली कोई भी चीज़ उन फ्रेम्स पर सिंक बिगाड़ देती है। शूटिंग के समय चेहरा साफ़ रखें।
नतीजे में केवल आवाज़ होती है। संगीत को Montage node में फिर से जोड़ें, अन्यथा डब की गई वर्शन मूल से ज़्यादा खाली लगेगी।
नहीं: यही तो सबसे अच्छी बात है। एक ही वीडियो, हर भाषा के लिए एक Voice-over node, और होंठ हर अनुवाद के साथ चलते हैं।
नहीं, नतीजे का ऑडियो ट्रैक वही आवाज़ है जो जोड़ी गई है। संगीत या माहौल बनाए रखने के लिए, उन्हें डब की गई वीडियो के ऊपर एक Montage node में फिर से डालें।
हाँ: Voice-over node में अपनी आवाज़ क्लोन करें, अनुवाद लिखें, और क्लोन की गई आवाज़ उसे पढ़ती है। होंठ उसके साथ चलते हैं।
हर पास में एक सेकंड से दो मिनट तक। इससे ज़्यादा के लिए, Montage node में वीडियो काटें और टुकड़ों को डब करें।
कीमत बनाई गई अवधि पर, प्रति सेकंड, निर्भर करती है, और जैसे ही वीडियो और आवाज़ जोड़ी जाती हैं, बटन पर दिख जाती है। कोई तकनीकी खराबी होने पर स्वचालित रूप से रिफ़ंड मिल जाता है।
हाँ, असली शूट जितनी ही अच्छी तरह। सामने से दिखते चेहरे वाला Wan, Seedance या Veo शॉट किसी भी अन्य वीडियो की तरह डब हो जाता है।
हाँ: केवल मुँह को फिर से गणना किया जाता है। हाथ, भौंहें, सिर की गतिविधियाँ मूल शूट की ही रहती हैं।
व्यक्ति जैसी ही रेंज की आवाज़, या उनका क्लोन। सिंक शुरू करने से पहले Voice-over node में आवाज़ को अकेले सुन लें।
AI से वीडियो डब करें, होंठ सिंक में
यह वर्कफ़्लो इस्तेमाल करेंमुफ़्त अकाउंट, बिना क्रेडिट कार्ड। वर्कफ़्लो आपके कैनवास में पहले से भरा हुआ खुलता है।