AI की मदद से किताब का ऑडियो अंश बनाएँ

कैनवस पर डाला गया PDF चैप्टर: एक Text node उसकी शुरुआत को शब्द-दर-शब्द कॉपी करता है, ElevenLabs की नैरेटर आवाज़ उसे पढ़ती है, नीचे एक इंस्ट्रूमेंटल बैकग्राउंड बजता है, और कवर एक 16:9 Montage में स्क्रीन पर बना रहता है: यह वह वीडियो है जिसे प्रकाशित करके लोगों को पहला चैप्टर सुनाया जा सकता है। पूरा वर्कफ़्लो बिना अकाउंट के देखा जा सकता है।

मूल उपन्यास का पहला चैप्टर, Media node में डाला गया एक PDFइंटरैक्टिव डेमो

असली वर्कफ़्लो, असली नतीजे। खुलकर घुमाइए और ज़ूम कीजिए।

यह वर्कफ़्लो इस्तेमाल करें

असली वर्कफ़्लो: एक Media node में PDF में उपन्यास का पहला चैप्टर, शुरुआत कॉपी करने वाला Claude Sonnet 5, नैरेशन के लिए ElevenLabs v3, बैकग्राउंड के लिए ElevenLabs Music, कवर के लिए GPT Image 2.5 Flare, और एक Montage node। दिखाए गए टेक्स्ट मॉडल के बिना-छेड़छाड़ जवाब हैं।

एक नज़र में

आप जो देते हैं
1 PDF · एक टेक्स्ट या ब्रीफ़
यह वर्कफ़्लो क्या बनाता है
3:4 में 1 इमेज · 1 ऑडियो पटरी, कुल 60 सेकंड · 1 वॉइस ओवर
कैनवास की बनावट
6 कनेक्शन से जुड़े 8 नोड
जुड़े हुए मॉडल
Claude Sonnet 5, ElevenLabs v3, ElevenLabs Music, GPT Image 2.5 Flare
एक पूरे राउंड का ख़र्च
लगभग 97 क्रेडिट, यानी $1.16
अकाउंट
डेमो बिना अकाउंट के भी देखा जा सकता है; जनरेट करने के लिए एक मुफ़्त अकाउंट चाहिए, जिसमें ट्रायल क्रेडिट शामिल हैं

पहला चैप्टर सुनवाना किसी किताब का सबसे बेहतरीन विज्ञापन है। PDF एक Media node में जाता है, और एक Text node उसे अपने "विश्लेषण के लिए इमेज या PDF" पोर्ट से पढ़कर शुरुआत को शब्द-दर-शब्द कॉपी करता है, कुछ भी फिर से लिखे बिना, 1,400 अक्षरों से पहले किसी पैराग्राफ के अंत तक: यानी डेढ़ मिनट की रीडिंग जितनी लंबाई।

Voice-over node उस जुड़े हुए टेक्स्ट को ElevenLabs v3 के साथ पढ़ता है, जिसमें सूची से चुनी गई एक नैरेटर आवाज़ होती है। Music node एक जुड़े हुए ब्रीफ से साठ सेकंड का इंस्ट्रूमेंटल बैकग्राउंड कंपोज़ करता है, जो Montage में कम वॉल्यूम पर लूप होता है। Image node GPT Image 2.5 Flare पर शीर्षक के साथ कवर बनाता है, और Montage उसे पूरी तरह, काले बैकग्राउंड पर, नैरेशन जितनी देर तक बनाए रखता है।

यह डेमो "North of Silence" की शुरुआत पढ़ता है, जो उदाहरण के लिए लिखा गया एक मूल उपन्यास है। PDF को अपने चैप्टर से बदलें, node में आवाज़ बदलें, कवर के प्रॉम्प्ट में शीर्षक बदलें। एक पूरा चैप्टर 3,000 अक्षरों वाले कई Voice-over nodes में पढ़ा जाता है, जो Montage में एक-दूसरे के साथ जोड़े जाते हैं। कवर और ट्रेलर इस सीरीज़ को पूरा करते हैं।

डेमो के वास्तविक रेंडर

ये ऊपर वाले वर्कफ़्लो की फ़ाइलें हैं, ठीक वैसी ही जैसी मॉडलों ने बनाई, बिना किसी सुधार के। जहाँ शुरुआती बिंदु मौजूद है, वहाँ उसे दिखाया गया है।

रेंडर

चैप्टर की शुरुआत का नैरेशन, ElevenLabs v3 द्वारा George की आवाज़ में पढ़ा गयाElevenLabs v3 से जनरेट किया गया
ElevenLabs Music द्वारा कंपोज़ किया गया साठ सेकंड का इंस्ट्रूमेंटल बैकग्राउंड, आवाज़ के नीचे लूप होता हुआElevenLabs Music से जनरेट किया गया
शीर्षक वाला कवर, GPT Image 2.5 Flare द्वारा बनाया गया, Montage में पूरी तरह दिखाया गयाGPT Image 2.5 Flare से जनरेट किया गया
एडिट किया गया अंश: स्क्रीन पर कवर, नैरेशन और बैकग्राउंड, प्रकाशित करने के लिए तैयार

यह किसके लिए है

वे लेखक और प्रकाशक जो बिना स्टूडियो या कलाकार के लोगों को पहला चैप्टर सुनाना चाहते हैं, या पूरी ऑडियोबुक बनाने से पहले किसी आवाज़ को आज़माना चाहते हैं।

कौन-सी फ़ाइलें देनी हैं

टेक्स्ट वाला PDF चैप्टर, स्कैन नहीं: Text node गद्य को जैसा है वैसा कॉपी करता है और आवाज़ उसे वाक्य-दर-वाक्य पढ़ती है।

कैसे करें

  1. 1

    चैप्टर का PDF डालें

    एक Media node उसे प्राप्त करता है। Text node शुरुआत को कॉपी करता है, कोई सारांश नहीं: पढ़ा जाने वाला आपका ही गद्य है, वाक्य-दर-वाक्य, किसी पैराग्राफ के अंत तक।

  2. 2

    आवाज़ चुनें और पढ़ें

    Voice-over node को टेक्स्ट केबल से मिलता है। लगभग बीस ElevenLabs v3 आवाज़ें, या एक क्लोन की गई आवाज़: डेमो में George का इस्तेमाल हुआ है, एक शांत नैरेटर। टेक्स्ट में [pause] या [whispers] टैग परफ़ॉर्मेंस को दिशा देता है।

  3. 3

    बैकग्राउंड कंपोज़ करें और कवर बनाएँ

    Music node जुड़े हुए ब्रीफ से साठ सेकंड का इंस्ट्रूमेंटल कंपोज़ करता है। Image node 3:4 में कवर के भीतर शीर्षक लिखता है, दो क्रेडिट। दोनों को नैरेशन छेड़े बिना फिर से बनाया जा सकता है।

  4. 4

    एडिट करें और प्रकाशित करें

    Montage पूरे कवर को काले बैकग्राउंड पर 16:9 में रखता है, नैरेशन एक ट्रैक पर, लूप होता बैकग्राउंड कम वॉल्यूम पर दूसरे ट्रैक पर, आखिर में एक फ़ेड के साथ। ब्राउज़र में रेंडर होता है, कोई क्रेडिट नहीं, mp4 में एक्सपोर्ट होता है।

वेरिएंट और इस्तेमाल के तरीके

वही कैनवास, अलग-अलग ज़रूरतों के लिए सेट किया हुआ: हर वेरिएंट में प्रॉम्प्ट की बस दो-तीन लाइनें बदलनी होती हैं।

पहले चैप्टर का अंश

यह डेमो है: शब्द-दर-शब्द कॉपी की गई शुरुआत, एक नैरेटर की आवाज़, एक बैकग्राउंड, स्क्रीन पर कवर। PDF और शीर्षक बदलें, बाकी सब वैसा रखें, और वीडियो आपकी किताब के लिए फिर से बन जाएगा।

कई हिस्सों में पूरा चैप्टर

3,000 अक्षरों के हर हिस्से के लिए एक Text node, हर एक के लिए एक Voice-over node, सब एक ही Montage में: पंद्रह मिनट का चैप्टर लगभग दस nodes में पढ़ा जाता है, नीचे बैकग्राउंड लूप होता रहता है।

लेखक द्वारा पढ़ा गया अंश

एक मिनट की रिकॉर्डिंग से Voice-over node में अपनी आवाज़ क्लोन करें, फिर उसे नैरेशन के लिए चुनें: पहला चैप्टर बिना किसी स्टूडियो के, आपकी ही आवाज़ में पढ़ा जाता है।

पॉडकास्ट वर्शन, बिना इमेज के

Image node और Montage हटा दें: नैरेशन और बैकग्राउंड nodes से सीधे mp3 में एक्सपोर्ट हो जाते हैं, पॉडकास्ट प्लेटफ़ॉर्म या किताब के पेज के लिए।

कई भाषाओं में अंश

Text node से हिस्से का अनुवाद करने के लिए कहें, Voice-over node की भाषा सेट करें, कवर वैसा ही रखें: वही वीडियो अंग्रेज़ी, स्पैनिश, जर्मन में, वही आवाज़ के साथ मौजूद रहती है।

आम ग़लतियाँ

टेक्स्ट के बजाय सारांश

निर्देश साफ़ कहता है कि गद्य को ठीक-ठीक कॉपी करना है। अगर मॉडल सारांश दे रहा है, तो उसने बिना टेक्स्ट का स्कैन किया गया PDF पढ़ा है: मैनुस्क्रिप्ट को टेक्स्ट वाले PDF में बदलें, पेज की इमेज में नहीं।

आवाज़ को ढक लेता बैकग्राउंड

Montage में म्यूज़िक 0.25 पर रखा गया है ताकि वह नैरेशन के नीचे रहे। एक तेज़ धुन वाला बैकग्राउंड कान खींच लेता है: ब्रीफ में बिना किसी थीम और बिना पर्कशन का बैकग्राउंड माँगें।

कटा हुआ कवर

Montage पूरी इमेज को काले बैकग्राउंड पर समाहित करने के लिए सेट है। कवर मोड में, 3:4 का कवर ऊपर और नीचे से अपना शीर्षक खो देता है: अंश के लिए contain मोड ही रखें।

सुझाए गए मॉडल

अक्सर पूछे जाने वाले सवाल

क्या पूरा चैप्टर पढ़ा जा सकता है?

हाँ, हिस्सों में: एक Voice-over node 3,000 अक्षरों तक पढ़ता है। Text node से अगला हिस्सा माँगें, Voice-over node को डुप्लिकेट करें, और Montage में हिस्सों को एक-दूसरे के साथ जोड़ दें। कीमत पढ़े गए अक्षरों के अनुसार तय होती है।

अंश की कीमत कितनी होती है?

डेमो के लिए लगभग साठ क्रेडिट: 1,400 अक्षरों का नैरेशन (लगभग बारह क्रेडिट), साठ सेकंड का बैकग्राउंड (लगभग पचास), कवर (दो) और PDF पढ़ना (दो से तीन)। कीमत क्लिक करने से पहले हर node पर दिख जाती है।

क्या आवाज़ विरामचिह्नों का ध्यान रखती है?

हाँ: ElevenLabs v3 अल्पविराम, पूर्णविराम और खाली लाइन से अलग किए गए पैराग्राफ को पहचानता है। लंबे विराम के लिए [pause] टैग, और धीमी आवाज़ के लिए [whispers]। ये टैग बोलकर नहीं पढ़े जाते।

अंश कितना लंबा होना चाहिए?

डेढ़ से दो मिनट, यानी 1,400 से 1,800 अक्षर: एक आवाज़ और एक सीन स्थापित करने के लिए पर्याप्त, और फ़ोन पर पूरा सुनने के लिए इतना छोटा।

क्या बाद में आवाज़ बदली जा सकती है?

हाँ, Voice-over node पर, टेक्स्ट को फिर से जनरेट किए बिना: कोई दूसरा टिम्बर चुनें और रीडिंग फिर से चलाएँ, Montage खुद अपडेट हो जाएगा।

क्या कवर ज़रूरी है?

नहीं, Montage के लिए कोई भी इमेज क्लिप काफ़ी है: लेखक की एक तस्वीर, जगह का कोई चित्रण। शीर्षक वाला कवर ही सबसे ज़्यादा शेयर होता है।

वीडियो कहाँ प्रकाशित करें?

किताब के पेज पर, सोशल नेटवर्क्स पर, किसी पॉडकास्ट के एपिसोड ज़ीरो के रूप में: mp4, 16:9, 1080p में, मिक्स किए गए साउंड के साथ निकलता है। 9:16 का Montage वर्टिकल वर्शन बनाता है।

AI की मदद से किताब का ऑडियो अंश बनाएँ

यह वर्कफ़्लो इस्तेमाल करें

मुफ़्त अकाउंट, बिना क्रेडिट कार्ड। वर्कफ़्लो आपके कैनवास में पहले से भरा हुआ खुलता है।