पहले चैप्टर का अंश
यह डेमो है: शब्द-दर-शब्द कॉपी की गई शुरुआत, एक नैरेटर की आवाज़, एक बैकग्राउंड, स्क्रीन पर कवर। PDF और शीर्षक बदलें, बाकी सब वैसा रखें, और वीडियो आपकी किताब के लिए फिर से बन जाएगा।
कैनवस पर डाला गया PDF चैप्टर: एक Text node उसकी शुरुआत को शब्द-दर-शब्द कॉपी करता है, ElevenLabs की नैरेटर आवाज़ उसे पढ़ती है, नीचे एक इंस्ट्रूमेंटल बैकग्राउंड बजता है, और कवर एक 16:9 Montage में स्क्रीन पर बना रहता है: यह वह वीडियो है जिसे प्रकाशित करके लोगों को पहला चैप्टर सुनाया जा सकता है। पूरा वर्कफ़्लो बिना अकाउंट के देखा जा सकता है।
असली वर्कफ़्लो: एक Media node में PDF में उपन्यास का पहला चैप्टर, शुरुआत कॉपी करने वाला Claude Sonnet 5, नैरेशन के लिए ElevenLabs v3, बैकग्राउंड के लिए ElevenLabs Music, कवर के लिए GPT Image 2.5 Flare, और एक Montage node। दिखाए गए टेक्स्ट मॉडल के बिना-छेड़छाड़ जवाब हैं।
एक नज़र में
पहला चैप्टर सुनवाना किसी किताब का सबसे बेहतरीन विज्ञापन है। PDF एक Media node में जाता है, और एक Text node उसे अपने "विश्लेषण के लिए इमेज या PDF" पोर्ट से पढ़कर शुरुआत को शब्द-दर-शब्द कॉपी करता है, कुछ भी फिर से लिखे बिना, 1,400 अक्षरों से पहले किसी पैराग्राफ के अंत तक: यानी डेढ़ मिनट की रीडिंग जितनी लंबाई।
Voice-over node उस जुड़े हुए टेक्स्ट को ElevenLabs v3 के साथ पढ़ता है, जिसमें सूची से चुनी गई एक नैरेटर आवाज़ होती है। Music node एक जुड़े हुए ब्रीफ से साठ सेकंड का इंस्ट्रूमेंटल बैकग्राउंड कंपोज़ करता है, जो Montage में कम वॉल्यूम पर लूप होता है। Image node GPT Image 2.5 Flare पर शीर्षक के साथ कवर बनाता है, और Montage उसे पूरी तरह, काले बैकग्राउंड पर, नैरेशन जितनी देर तक बनाए रखता है।
यह डेमो "North of Silence" की शुरुआत पढ़ता है, जो उदाहरण के लिए लिखा गया एक मूल उपन्यास है। PDF को अपने चैप्टर से बदलें, node में आवाज़ बदलें, कवर के प्रॉम्प्ट में शीर्षक बदलें। एक पूरा चैप्टर 3,000 अक्षरों वाले कई Voice-over nodes में पढ़ा जाता है, जो Montage में एक-दूसरे के साथ जोड़े जाते हैं। कवर और ट्रेलर इस सीरीज़ को पूरा करते हैं।
ये ऊपर वाले वर्कफ़्लो की फ़ाइलें हैं, ठीक वैसी ही जैसी मॉडलों ने बनाई, बिना किसी सुधार के। जहाँ शुरुआती बिंदु मौजूद है, वहाँ उसे दिखाया गया है।
रेंडर
वे लेखक और प्रकाशक जो बिना स्टूडियो या कलाकार के लोगों को पहला चैप्टर सुनाना चाहते हैं, या पूरी ऑडियोबुक बनाने से पहले किसी आवाज़ को आज़माना चाहते हैं।
टेक्स्ट वाला PDF चैप्टर, स्कैन नहीं: Text node गद्य को जैसा है वैसा कॉपी करता है और आवाज़ उसे वाक्य-दर-वाक्य पढ़ती है।
चैप्टर का PDF डालें
एक Media node उसे प्राप्त करता है। Text node शुरुआत को कॉपी करता है, कोई सारांश नहीं: पढ़ा जाने वाला आपका ही गद्य है, वाक्य-दर-वाक्य, किसी पैराग्राफ के अंत तक।
आवाज़ चुनें और पढ़ें
Voice-over node को टेक्स्ट केबल से मिलता है। लगभग बीस ElevenLabs v3 आवाज़ें, या एक क्लोन की गई आवाज़: डेमो में George का इस्तेमाल हुआ है, एक शांत नैरेटर। टेक्स्ट में [pause] या [whispers] टैग परफ़ॉर्मेंस को दिशा देता है।
बैकग्राउंड कंपोज़ करें और कवर बनाएँ
Music node जुड़े हुए ब्रीफ से साठ सेकंड का इंस्ट्रूमेंटल कंपोज़ करता है। Image node 3:4 में कवर के भीतर शीर्षक लिखता है, दो क्रेडिट। दोनों को नैरेशन छेड़े बिना फिर से बनाया जा सकता है।
एडिट करें और प्रकाशित करें
Montage पूरे कवर को काले बैकग्राउंड पर 16:9 में रखता है, नैरेशन एक ट्रैक पर, लूप होता बैकग्राउंड कम वॉल्यूम पर दूसरे ट्रैक पर, आखिर में एक फ़ेड के साथ। ब्राउज़र में रेंडर होता है, कोई क्रेडिट नहीं, mp4 में एक्सपोर्ट होता है।
वही कैनवास, अलग-अलग ज़रूरतों के लिए सेट किया हुआ: हर वेरिएंट में प्रॉम्प्ट की बस दो-तीन लाइनें बदलनी होती हैं।
यह डेमो है: शब्द-दर-शब्द कॉपी की गई शुरुआत, एक नैरेटर की आवाज़, एक बैकग्राउंड, स्क्रीन पर कवर। PDF और शीर्षक बदलें, बाकी सब वैसा रखें, और वीडियो आपकी किताब के लिए फिर से बन जाएगा।
3,000 अक्षरों के हर हिस्से के लिए एक Text node, हर एक के लिए एक Voice-over node, सब एक ही Montage में: पंद्रह मिनट का चैप्टर लगभग दस nodes में पढ़ा जाता है, नीचे बैकग्राउंड लूप होता रहता है।
एक मिनट की रिकॉर्डिंग से Voice-over node में अपनी आवाज़ क्लोन करें, फिर उसे नैरेशन के लिए चुनें: पहला चैप्टर बिना किसी स्टूडियो के, आपकी ही आवाज़ में पढ़ा जाता है।
Image node और Montage हटा दें: नैरेशन और बैकग्राउंड nodes से सीधे mp3 में एक्सपोर्ट हो जाते हैं, पॉडकास्ट प्लेटफ़ॉर्म या किताब के पेज के लिए।
Text node से हिस्से का अनुवाद करने के लिए कहें, Voice-over node की भाषा सेट करें, कवर वैसा ही रखें: वही वीडियो अंग्रेज़ी, स्पैनिश, जर्मन में, वही आवाज़ के साथ मौजूद रहती है।
निर्देश साफ़ कहता है कि गद्य को ठीक-ठीक कॉपी करना है। अगर मॉडल सारांश दे रहा है, तो उसने बिना टेक्स्ट का स्कैन किया गया PDF पढ़ा है: मैनुस्क्रिप्ट को टेक्स्ट वाले PDF में बदलें, पेज की इमेज में नहीं।
Montage में म्यूज़िक 0.25 पर रखा गया है ताकि वह नैरेशन के नीचे रहे। एक तेज़ धुन वाला बैकग्राउंड कान खींच लेता है: ब्रीफ में बिना किसी थीम और बिना पर्कशन का बैकग्राउंड माँगें।
Montage पूरी इमेज को काले बैकग्राउंड पर समाहित करने के लिए सेट है। कवर मोड में, 3:4 का कवर ऊपर और नीचे से अपना शीर्षक खो देता है: अंश के लिए contain मोड ही रखें।
हाँ, हिस्सों में: एक Voice-over node 3,000 अक्षरों तक पढ़ता है। Text node से अगला हिस्सा माँगें, Voice-over node को डुप्लिकेट करें, और Montage में हिस्सों को एक-दूसरे के साथ जोड़ दें। कीमत पढ़े गए अक्षरों के अनुसार तय होती है।
डेमो के लिए लगभग साठ क्रेडिट: 1,400 अक्षरों का नैरेशन (लगभग बारह क्रेडिट), साठ सेकंड का बैकग्राउंड (लगभग पचास), कवर (दो) और PDF पढ़ना (दो से तीन)। कीमत क्लिक करने से पहले हर node पर दिख जाती है।
हाँ: ElevenLabs v3 अल्पविराम, पूर्णविराम और खाली लाइन से अलग किए गए पैराग्राफ को पहचानता है। लंबे विराम के लिए [pause] टैग, और धीमी आवाज़ के लिए [whispers]। ये टैग बोलकर नहीं पढ़े जाते।
डेढ़ से दो मिनट, यानी 1,400 से 1,800 अक्षर: एक आवाज़ और एक सीन स्थापित करने के लिए पर्याप्त, और फ़ोन पर पूरा सुनने के लिए इतना छोटा।
हाँ, Voice-over node पर, टेक्स्ट को फिर से जनरेट किए बिना: कोई दूसरा टिम्बर चुनें और रीडिंग फिर से चलाएँ, Montage खुद अपडेट हो जाएगा।
नहीं, Montage के लिए कोई भी इमेज क्लिप काफ़ी है: लेखक की एक तस्वीर, जगह का कोई चित्रण। शीर्षक वाला कवर ही सबसे ज़्यादा शेयर होता है।
किताब के पेज पर, सोशल नेटवर्क्स पर, किसी पॉडकास्ट के एपिसोड ज़ीरो के रूप में: mp4, 16:9, 1080p में, मिक्स किए गए साउंड के साथ निकलता है। 9:16 का Montage वर्टिकल वर्शन बनाता है।
AI की मदद से किताब का ऑडियो अंश बनाएँ
यह वर्कफ़्लो इस्तेमाल करेंमुफ़्त अकाउंट, बिना क्रेडिट कार्ड। वर्कफ़्लो आपके कैनवास में पहले से भरा हुआ खुलता है।