सभी टूल

AI से किसी फ़ोटो को बोलते हुए दिखाएँ

एक चेहरे की फ़ोटो और कैटलॉग की किसी आवाज़ में पढ़ा गया टेक्स्ट: InfiniTalk उस व्यक्ति को बोलता हुआ दिखा देता है, होंठों की हरकत, पलकों का झपकना और सिर की हलचल सब शामिल। वीडियो उतनी ही देर चलता है जितनी आवाज़ चलती है। पूरा वर्कफ़्लो बिना खाते के देखा जा सकता है।

इंटरैक्टिव डेमो

असली वर्कफ़्लो, असली नतीजे। खुलकर घुमाइए और ज़ूम कीजिए।

यह वर्कफ़्लो इस्तेमाल करें

असली वर्कफ़्लो: एक Media नोड में एक फ़ोटो, दो टेक्स्ट जिन्हें अलग-अलग Voice-over नोड पढ़ते हैं, और InfiniTalk पर सेट दो Video नोड, जो image पोर्ट से फ़ोटो और voice पोर्ट से आवाज़ प्राप्त करते हैं।

एक नज़र में

यह वर्कफ़्लो क्या बनाता है
480p में 18 सेकंड की 2 वीडियो, फ़ॉर्मैट 1:1 · 2 वॉइस ओवर
कैनवास की बनावट
6 कनेक्शन से जुड़े 8 नोड
जुड़े हुए मॉडल
ElevenLabs v3, InfiniTalk
एक पूरे राउंड का ख़र्च
लगभग 446 क्रेडिट, यानी $5.35

एक ही फ़ोटो काफ़ी है। न कोई वीडियो शूट करनी है, न कोई अवतार सेट करना है: फ़ोटो का चेहरा बोलने लगता है, होंठ हर शब्दांश के साथ सही ढंग से चलते हैं, पलकें झपकती हैं, और वाक्य के साथ सिर की छोटी-छोटी हरकतें भी होती हैं। नतीजा ऐसा दिखता है जैसे कोई कैमरे के सामने सीधे बोल रहा हो, और यह एक फोन से खींची फ़ोटो से बना है।

टेक्स्ट को Voice-over नोड में पढ़ा जाता है, कैटलॉग की किसी आवाज़ से (ElevenLabs v3 सबसे आगे) या किसी क्लोन की गई आवाज़ से। InfiniTalk](/models/lipsync-infinitalk) पर सेट Video नोड फ़ोटो और आवाज़ दोनों प्राप्त करता है, और ऐसा वीडियो बनाता है जो ठीक उतनी ही देर चलता है जितनी ऑडियो, अधिकतम अट्ठाईस सेकंड तक। कीमत इस अवधि पर निर्भर करती है, जो फ़ाइल पर मापी जाती है, और क्लिक करने से पहले दिख जाती है।

यह बोलते हुए अवतार जैसा ही तरीका है, लेकिन आपके अपने चेहरे से, या किसी जनरेट किए गए किरदार, किसी बनी हुई मैस्कॉट या किसी पुराने पोर्ट्रेट से। जन्मदिन का संदेश, किसी प्रोडक्ट की प्रस्तुति, सोशल नेटवर्क पर घोषणा: डेमो में एक ही फ़ोटो पर दो अलग-अलग संदेश दिखाए गए हैं।

कैसे करें

  1. 1

    सामने से ली गई फ़ोटो चुनें

    स्पष्ट चेहरा, बंद और दिखता हुआ मुँह, सामने से रोशनी, सादा बैकग्राउंड। फोन से लिया पोर्ट्रेट बहुत बढ़िया काम करता है। चश्मा और दाढ़ी चल जाते हैं, मुँह के आगे हाथ या प्रोफ़ाइल तस्वीर नहीं चलती।

  2. 2

    टेक्स्ट लिखें और आवाज़ चुनें

    Voice-over नोड आपके लिखे टेक्स्ट को चुनी गई आवाज़ में, आपकी भाषा में पढ़ता है। बीस शब्दों का वाक्य सात से आठ सेकंड का बनता है। पहले आवाज़ जनरेट करें: यही वीडियो की अवधि और कीमत तय करती है।

  3. 3

    वीडियो जनरेट करें

    InfiniTalk नोड आवाज़ की मापी गई अवधि और सटीक कीमत दिखाता है। क्लिक करें: चेहरा बोलने लगता है, सोशल नेटवर्क के लिए 480p में या प्रोजेक्ट करने योग्य रेंडर के लिए 720p में।

  4. 4

    टेक्स्ट लंबा हो तो जोड़ें

    अट्ठाईस सेकंड से ज़्यादा आवाज़ होने पर, टेक्स्ट को दो हिस्सों में बाँटें और उन्हें Montage नोड में मुफ़्त में जोड़ें, जैसे दूसरे वीडियो वर्कफ़्लो में किया जाता है।

वेरिएंट और इस्तेमाल के तरीके

वही कैनवास, अलग-अलग ज़रूरतों के लिए सेट किया हुआ: हर वेरिएंट में प्रॉम्प्ट की बस दो-तीन लाइनें बदलनी होती हैं।

जन्मदिन का संदेश

जिस व्यक्ति का जन्मदिन है उसकी फ़ोटो, बीस शब्दों का टेक्स्ट जो किसी गर्मजोशी भरी आवाज़ में पढ़ा गया हो: यही डेमो का दूसरा उदाहरण है। वीडियो को वैसा ही मैसेज में भेज दिया जाता है, और किसी को खुद की वीडियो बनाने की ज़रूरत नहीं पड़ती।

बिना शूटिंग के प्रोडक्ट प्रस्तुति

जनरेट किया गया पोर्ट्रेट एक प्रेज़ेंटर बन जाता है: लॉन्च का टेक्स्ट Voice-over नोड में, फ़ोटो Media नोड में, और वीडियो 720p में तैयार होता है, किसी प्रोडक्ट पेज या UGC विज्ञापन के लिए तैयार।

एक पुराना पोर्ट्रेट जो अपनी कहानी सुनाता है

स्कैन की गई किसी पारिवारिक फ़ोटो, पहले व्यक्ति में लिखा गया टेक्स्ट: चेहरा जीवंत होकर बोलने लगता है। अगर फ़ोटो छोटी या ख़राब है तो पहले उसे Enhance नोड से गुज़ारें, फिर InfiniTalk से।

घोषणा करती हुई मैस्कॉट

साफ़ दिखने वाले मुँह वाला बनाया गया किरदार भी काम करता है: मॉडल किसी ड्रॉइंग के होंठों को भी उतनी ही अच्छी तरह चलाता है जितना किसी फ़ोटो के। सोशल नेटवर्क पर किसी ब्रांड की घोषणा के लिए एकदम सही, कैटलॉग की किसी उत्साहित आवाज़ के साथ।

तीन भाषाओं में एक ही संदेश

एक फ़ोटो, तीन भाषाओं में तीन Voice-over नोड, तीन InfiniTalk नोड: वही व्यक्ति अंग्रेज़ी, स्पेनिश और फ़्रेंच बोलता है, हर बार सटीक होंठों के साथ। पहले से शूट की गई किसी वीडियो से शुरुआत करने के लिए डबिंग देखें।

पहले बोलने वाली फ़ोटो, फिर हरकत करने वाली फ़ोटो

बनाई गई वीडियो को लें और उसे फ़ोटो को नाचते हुए दिखाएँ से गुज़ारें, या किसी Video नोड में संदर्भ के रूप में भेजें: पहले बोलना, फिर शरीर की हरकत।

आम ग़लतियाँ

प्रोफ़ाइल में या बहुत तिरछा चेहरा

मॉडल को पूरा मुँह दिखना ज़रूरी है। सामने से या थोड़े तिरछे कोण में, सिंक साफ़ बनता है; प्रोफ़ाइल में होंठ विकृत हो जाते हैं।

फ़ोटो में खुला या छिपा हुआ मुँह

दाँत दिखते हुए मुस्कान, ठुड्डी पर हाथ, आगे रखा माइक्रोफ़ोन: ये सब बाधाएँ बनते हैं। मुँह बंद हो, चेहरा साफ़ दिखे, तो नतीजा एकदम सटीक आता है।

टेक्स्ट को Video नोड में लिखना

InfiniTalk नोड का प्रॉम्प्ट रवैया बताता है, टेक्स्ट नहीं। व्यक्ति क्या बोलता है, यह जोड़ी गई आवाज़ तय करती है: टेक्स्ट Voice-over नोड में जाता है।

एक ही पास के लिए बहुत लंबी आवाज़

अट्ठाईस सेकंड से ज़्यादा होने पर, नोड जनरेट करने से पहले ही मना कर देता है, बिना कोई शुल्क लिए। इसे दो हिस्सों में बाँटें और Montage नोड में जोड़ें।

सुझाए गए मॉडल

अक्सर पूछे जाने वाले सवाल

फ़ोटो कितनी देर तक बोल सकती है?

प्रत्येक जनरेशन में दो से अट्ठाईस सेकंड तक, यानी सामान्य गति से लगभग साठ शब्द। वीडियो ठीक उतनी ही देर चलता है जितनी जोड़ी गई आवाज़: कुछ भी सेट करने की ज़रूरत नहीं।

क्या मैं अपनी खुद की आवाज़ इस्तेमाल कर सकता हूँ?

हाँ। किसी Media नोड में रिकॉर्डिंग अपलोड करें और उसे voice पोर्ट से जोड़ें, या Voice-over नोड में अपनी आवाज़ क्लोन करें और उससे कोई भी टेक्स्ट पढ़वाएँ।

क्या मेरी अपनी फ़ोटो ज़रूरी है, या जनरेट किया गया किरदार भी काम करता है?

दोनों चलते हैं। Image नोड से बना पोर्ट्रेट, बनी हुई मैस्कॉट या कोई पुरानी फ़ोटो, सेल्फी जितने ही अच्छे ढंग से बोलते हैं, बस चेहरा सामने की तरफ़ और मुँह दिखता होना चाहिए।

क्या जनरेशन असफल होने पर भी शुल्क लगता है?

नहीं। शुरू करते समय कीमत आरक्षित होती है और तकनीकी असफलता की स्थिति में स्वचालित रूप से वापस कर दी जाती है। सटीक राशि क्लिक करने से पहले बटन पर दिख जाती है।

बोलते हुए अवतार से इसमें क्या फ़र्क़ है?

बोलते हुए अवतार एक बार में, Veo पर, एक कल्पित प्रेज़ेंटर को उसकी आवाज़ के साथ जनरेट करता है। यहाँ, आपकी अपनी फ़ोटो बोलती है, आपकी चुनी हुई आवाज़ के साथ, और किरदार को दोबारा बनाए बिना टेक्स्ट बदला जा सकता है।

क्या भाषा चुनी जा सकती है?

हाँ, Voice-over नोड में: ElevenLabs की आवाज़ें चौदह भाषाएँ पढ़ती हैं। लिप-सिंक ध्वनियों के अनुसार होता है, भाषा चाहे कोई भी हो।

क्या वीडियो 16:9 में या वर्टिकल में होती है?

InfiniTalk फ़ोटो के करीब का फ़्रेम बनाता है, 480p या 720p में। किसी सटीक फ़ॉर्मैट के लिए, बाद में Montage नोड में रीफ़्रेम करें, जो 9:16, 1:1 और 16:9 स्वीकार करता है।

क्या मैं कई लोगों को बोलते हुए दिखा सकता हूँ?

प्रति नोड एक व्यक्ति। किसी संवाद के लिए, दो फ़ोटो को उनकी अपनी-अपनी आवाज़ में बोलते हुए बनाएँ, फिर Montage नोड में शॉट्स को बदल-बदल कर जोड़ें।

AI से किसी फ़ोटो को बोलते हुए दिखाएँ

यह वर्कफ़्लो इस्तेमाल करें

मुफ़्त अकाउंट, बिना क्रेडिट कार्ड। वर्कफ़्लो आपके कैनवास में पहले से भरा हुआ खुलता है।