जन्मदिन का संदेश
जिस व्यक्ति का जन्मदिन है उसकी फ़ोटो, बीस शब्दों का टेक्स्ट जो किसी गर्मजोशी भरी आवाज़ में पढ़ा गया हो: यही डेमो का दूसरा उदाहरण है। वीडियो को वैसा ही मैसेज में भेज दिया जाता है, और किसी को खुद की वीडियो बनाने की ज़रूरत नहीं पड़ती।
एक चेहरे की फ़ोटो और कैटलॉग की किसी आवाज़ में पढ़ा गया टेक्स्ट: InfiniTalk उस व्यक्ति को बोलता हुआ दिखा देता है, होंठों की हरकत, पलकों का झपकना और सिर की हलचल सब शामिल। वीडियो उतनी ही देर चलता है जितनी आवाज़ चलती है। पूरा वर्कफ़्लो बिना खाते के देखा जा सकता है।
असली वर्कफ़्लो, असली नतीजे। खुलकर घुमाइए और ज़ूम कीजिए।
यह वर्कफ़्लो इस्तेमाल करेंअसली वर्कफ़्लो: एक Media नोड में एक फ़ोटो, दो टेक्स्ट जिन्हें अलग-अलग Voice-over नोड पढ़ते हैं, और InfiniTalk पर सेट दो Video नोड, जो image पोर्ट से फ़ोटो और voice पोर्ट से आवाज़ प्राप्त करते हैं।
एक नज़र में
एक ही फ़ोटो काफ़ी है। न कोई वीडियो शूट करनी है, न कोई अवतार सेट करना है: फ़ोटो का चेहरा बोलने लगता है, होंठ हर शब्दांश के साथ सही ढंग से चलते हैं, पलकें झपकती हैं, और वाक्य के साथ सिर की छोटी-छोटी हरकतें भी होती हैं। नतीजा ऐसा दिखता है जैसे कोई कैमरे के सामने सीधे बोल रहा हो, और यह एक फोन से खींची फ़ोटो से बना है।
टेक्स्ट को Voice-over नोड में पढ़ा जाता है, कैटलॉग की किसी आवाज़ से (ElevenLabs v3 सबसे आगे) या किसी क्लोन की गई आवाज़ से। InfiniTalk](/models/lipsync-infinitalk) पर सेट Video नोड फ़ोटो और आवाज़ दोनों प्राप्त करता है, और ऐसा वीडियो बनाता है जो ठीक उतनी ही देर चलता है जितनी ऑडियो, अधिकतम अट्ठाईस सेकंड तक। कीमत इस अवधि पर निर्भर करती है, जो फ़ाइल पर मापी जाती है, और क्लिक करने से पहले दिख जाती है।
यह बोलते हुए अवतार जैसा ही तरीका है, लेकिन आपके अपने चेहरे से, या किसी जनरेट किए गए किरदार, किसी बनी हुई मैस्कॉट या किसी पुराने पोर्ट्रेट से। जन्मदिन का संदेश, किसी प्रोडक्ट की प्रस्तुति, सोशल नेटवर्क पर घोषणा: डेमो में एक ही फ़ोटो पर दो अलग-अलग संदेश दिखाए गए हैं।
सामने से ली गई फ़ोटो चुनें
स्पष्ट चेहरा, बंद और दिखता हुआ मुँह, सामने से रोशनी, सादा बैकग्राउंड। फोन से लिया पोर्ट्रेट बहुत बढ़िया काम करता है। चश्मा और दाढ़ी चल जाते हैं, मुँह के आगे हाथ या प्रोफ़ाइल तस्वीर नहीं चलती।
टेक्स्ट लिखें और आवाज़ चुनें
Voice-over नोड आपके लिखे टेक्स्ट को चुनी गई आवाज़ में, आपकी भाषा में पढ़ता है। बीस शब्दों का वाक्य सात से आठ सेकंड का बनता है। पहले आवाज़ जनरेट करें: यही वीडियो की अवधि और कीमत तय करती है।
वीडियो जनरेट करें
InfiniTalk नोड आवाज़ की मापी गई अवधि और सटीक कीमत दिखाता है। क्लिक करें: चेहरा बोलने लगता है, सोशल नेटवर्क के लिए 480p में या प्रोजेक्ट करने योग्य रेंडर के लिए 720p में।
टेक्स्ट लंबा हो तो जोड़ें
अट्ठाईस सेकंड से ज़्यादा आवाज़ होने पर, टेक्स्ट को दो हिस्सों में बाँटें और उन्हें Montage नोड में मुफ़्त में जोड़ें, जैसे दूसरे वीडियो वर्कफ़्लो में किया जाता है।
वही कैनवास, अलग-अलग ज़रूरतों के लिए सेट किया हुआ: हर वेरिएंट में प्रॉम्प्ट की बस दो-तीन लाइनें बदलनी होती हैं।
जिस व्यक्ति का जन्मदिन है उसकी फ़ोटो, बीस शब्दों का टेक्स्ट जो किसी गर्मजोशी भरी आवाज़ में पढ़ा गया हो: यही डेमो का दूसरा उदाहरण है। वीडियो को वैसा ही मैसेज में भेज दिया जाता है, और किसी को खुद की वीडियो बनाने की ज़रूरत नहीं पड़ती।
जनरेट किया गया पोर्ट्रेट एक प्रेज़ेंटर बन जाता है: लॉन्च का टेक्स्ट Voice-over नोड में, फ़ोटो Media नोड में, और वीडियो 720p में तैयार होता है, किसी प्रोडक्ट पेज या UGC विज्ञापन के लिए तैयार।
स्कैन की गई किसी पारिवारिक फ़ोटो, पहले व्यक्ति में लिखा गया टेक्स्ट: चेहरा जीवंत होकर बोलने लगता है। अगर फ़ोटो छोटी या ख़राब है तो पहले उसे Enhance नोड से गुज़ारें, फिर InfiniTalk से।
साफ़ दिखने वाले मुँह वाला बनाया गया किरदार भी काम करता है: मॉडल किसी ड्रॉइंग के होंठों को भी उतनी ही अच्छी तरह चलाता है जितना किसी फ़ोटो के। सोशल नेटवर्क पर किसी ब्रांड की घोषणा के लिए एकदम सही, कैटलॉग की किसी उत्साहित आवाज़ के साथ।
एक फ़ोटो, तीन भाषाओं में तीन Voice-over नोड, तीन InfiniTalk नोड: वही व्यक्ति अंग्रेज़ी, स्पेनिश और फ़्रेंच बोलता है, हर बार सटीक होंठों के साथ। पहले से शूट की गई किसी वीडियो से शुरुआत करने के लिए डबिंग देखें।
बनाई गई वीडियो को लें और उसे फ़ोटो को नाचते हुए दिखाएँ से गुज़ारें, या किसी Video नोड में संदर्भ के रूप में भेजें: पहले बोलना, फिर शरीर की हरकत।
मॉडल को पूरा मुँह दिखना ज़रूरी है। सामने से या थोड़े तिरछे कोण में, सिंक साफ़ बनता है; प्रोफ़ाइल में होंठ विकृत हो जाते हैं।
दाँत दिखते हुए मुस्कान, ठुड्डी पर हाथ, आगे रखा माइक्रोफ़ोन: ये सब बाधाएँ बनते हैं। मुँह बंद हो, चेहरा साफ़ दिखे, तो नतीजा एकदम सटीक आता है।
InfiniTalk नोड का प्रॉम्प्ट रवैया बताता है, टेक्स्ट नहीं। व्यक्ति क्या बोलता है, यह जोड़ी गई आवाज़ तय करती है: टेक्स्ट Voice-over नोड में जाता है।
अट्ठाईस सेकंड से ज़्यादा होने पर, नोड जनरेट करने से पहले ही मना कर देता है, बिना कोई शुल्क लिए। इसे दो हिस्सों में बाँटें और Montage नोड में जोड़ें।
प्रत्येक जनरेशन में दो से अट्ठाईस सेकंड तक, यानी सामान्य गति से लगभग साठ शब्द। वीडियो ठीक उतनी ही देर चलता है जितनी जोड़ी गई आवाज़: कुछ भी सेट करने की ज़रूरत नहीं।
हाँ। किसी Media नोड में रिकॉर्डिंग अपलोड करें और उसे voice पोर्ट से जोड़ें, या Voice-over नोड में अपनी आवाज़ क्लोन करें और उससे कोई भी टेक्स्ट पढ़वाएँ।
दोनों चलते हैं। Image नोड से बना पोर्ट्रेट, बनी हुई मैस्कॉट या कोई पुरानी फ़ोटो, सेल्फी जितने ही अच्छे ढंग से बोलते हैं, बस चेहरा सामने की तरफ़ और मुँह दिखता होना चाहिए।
नहीं। शुरू करते समय कीमत आरक्षित होती है और तकनीकी असफलता की स्थिति में स्वचालित रूप से वापस कर दी जाती है। सटीक राशि क्लिक करने से पहले बटन पर दिख जाती है।
बोलते हुए अवतार एक बार में, Veo पर, एक कल्पित प्रेज़ेंटर को उसकी आवाज़ के साथ जनरेट करता है। यहाँ, आपकी अपनी फ़ोटो बोलती है, आपकी चुनी हुई आवाज़ के साथ, और किरदार को दोबारा बनाए बिना टेक्स्ट बदला जा सकता है।
हाँ, Voice-over नोड में: ElevenLabs की आवाज़ें चौदह भाषाएँ पढ़ती हैं। लिप-सिंक ध्वनियों के अनुसार होता है, भाषा चाहे कोई भी हो।
InfiniTalk फ़ोटो के करीब का फ़्रेम बनाता है, 480p या 720p में। किसी सटीक फ़ॉर्मैट के लिए, बाद में Montage नोड में रीफ़्रेम करें, जो 9:16, 1:1 और 16:9 स्वीकार करता है।
प्रति नोड एक व्यक्ति। किसी संवाद के लिए, दो फ़ोटो को उनकी अपनी-अपनी आवाज़ में बोलते हुए बनाएँ, फिर Montage नोड में शॉट्स को बदल-बदल कर जोड़ें।
AI से किसी फ़ोटो को बोलते हुए दिखाएँ
यह वर्कफ़्लो इस्तेमाल करेंमुफ़्त अकाउंट, बिना क्रेडिट कार्ड। वर्कफ़्लो आपके कैनवास में पहले से भरा हुआ खुलता है।