फ़ोन पर इंटरव्यू
किताबी मामला: कैफ़े में दो लोग, बीच में रखा फ़ोन। फ़िल्टर कप और कॉफ़ी मशीन हटाता है, दोनों आवाज़ें रहती हैं, अपनी दूरी के साथ। आम तौर पर एक बार काफ़ी है।
शोर भरी टेरेस पर बोला गया वॉइस मेमो, कैटलॉग के दोनों नॉइज़ रिमूवर, DeepFilterNet 3 और ElevenLabs Audio Isolation, से अगल-बगल गुज़ारा हुआ। पूरा वर्कफ़्लो, बिना खाता बनाए।
असली वर्कफ़्लो, असली नतीजे। खुलकर घुमाइए और ज़ूम कीजिए।
यह वर्कफ़्लो इस्तेमाल करेंअसली वर्कफ़्लो: वही शोर वाला मेमो दो «आवाज़ सुधारें» नोड में जाता है, और आप सुनते हैं कि किसने क्या हटाया।
एक नज़र में
कैफ़े में फ़ोन पर रिकॉर्ड इंटरव्यू, सड़क पर बोला गया वॉइस मेमो, पीछे फ़्रिज की आवाज़ वाली पॉडकास्ट आवाज़: बैकग्राउंड शोर ही काम की रिकॉर्डिंग को दोबारा करने वाली रिकॉर्डिंग से अलग करता है। यह वर्कफ़्लो कैटलॉग के उन दो मॉडलों से उसे हटाता है जो यह कर सकते हैं, और उन्हें अगल-बगल रखता है क्योंकि वे एक तरह से काम नहीं करते।
DeepFilterNet 3 एक फ़िल्टर है: जो आवाज़ नहीं है उसे हटाता है और कमरे की हवा रहने देता है, नतीजा क़ुदरती रहता है। ElevenLabs Audio Isolation आवाज़ को फिर से गढ़ता है: ज़्यादा सूखी, रेडियो जैसी, व्यंजनों पर कभी-कभी थोड़ी कृत्रिम। डेमो के मेमो में, जो जान-बूझकर एक साफ़ आवाज़ में सड़क का माहौल और भनभनाहट मिलाकर बनाया गया है, हमें ठीक-ठीक पता है कि क्या हटाना था।
आपकी फ़ाइल नोड के इंपोर्ट बटन से आती है, एक बार में दस मिनट तक, और क़ीमत सेकंड के हिसाब से गिनी जाती है: चौदह सेकंड पर दोनों सफ़ाइयाँ 7 सेंट की पड़ती हैं, और अकेला DeepFilterNet नौ क्रेडिट प्रति मिनट।
रिकॉर्डिंग इंपोर्ट करें
MP3, WAV, M4A या OGG, दस मिनट तक। नोड अवधि पढ़ता है और किसी भी क्लिक से पहले क़ीमत दिखाता है। कैनवास पर कहीं और बना ऑडियो भी पोर्ट से जोड़ा जा सकता है।
फ़िल्टर चलाएँ
पहले DeepFilterNet 3: सबसे सस्ता और सबसे वफ़ादार। अगर आवाज़ साफ़ निकले और कमरा अब भी मौजूद हो, तो काम हो गया।
पुनर्निर्माण आज़माएँ
अगर शोर तेज़ था, या आवाज़ को संगीत पर बैठना है, तो बग़ल में आइसोलेशन चलाइए। वह ज़्यादा सूखी निकलती है, जो एडिट में बेहतर घुलती है।
व्यंजनों को सुनें
वहीं दोनों अलग होते हैं: «स» और «त» की ध्वनियाँ वे हैं जिन्हें नॉइज़ रिमूवर सबसे पहले बिगाड़ता है। जीतने वाली फ़ाइल एडिट में जाती है या नोड से डाउनलोड होती है।
वही कैनवास, अलग-अलग ज़रूरतों के लिए सेट किया हुआ: हर वेरिएंट में प्रॉम्प्ट की बस दो-तीन लाइनें बदलनी होती हैं।
किताबी मामला: कैफ़े में दो लोग, बीच में रखा फ़ोन। फ़िल्टर कप और कॉफ़ी मशीन हटाता है, दोनों आवाज़ें रहती हैं, अपनी दूरी के साथ। आम तौर पर एक बार काफ़ी है।
फ़्रिज, खिड़की से सड़क, कंप्यूटर का पंखा: एक स्थिर, हल्का शोर जिसे फ़िल्टर बिना निशान हटा देता है। माइक के पास की आवाज़ पर DeepFilterNet ही चाहिए, पुनर्निर्माण ज़्यादा होगा।
डेमो का मेमो। तेज़ और बदलता शोर, गाड़ियाँ और राहगीर। फ़िल्टर एक परत छोड़ देता है, पुनर्निर्माण उसे मिटा देता है: यहाँ वही जीतता है, क्योंकि आप समझना चाहते हैं, माहौल रखना नहीं।
बिना स्टूडियो फ़िल्माया वॉइस ओवर, तस्वीरों और संगीत पर रखने के लिए। आइसोलेशन का सूखा नतीजा मोंटाज में उस आवाज़ से बेहतर घुलता है जो अब भी अपने पीछे कमरा घसीट रही हो।
डिजिटल की गई कैसेट, अपनी सरसराहट और भनभनाहट के साथ। फ़िल्टर सरसराहट हटाता है और आवाज़ जैसी थी वैसी रखता है, और यादों से यही चाहिए: साफ़, दोबारा लिखी हुई नहीं।
दूर की आवाज़, गूँज, खाँसी। दोनों शोर साफ़ करते हैं; कोई भी हॉल की गूँज छोटी नहीं करता, जो शोर नहीं बल्कि जगह है। साफ़ पर अब भी दूर की आवाज़ की उम्मीद रखिए।
क़ीमत सेकंड के हिसाब से है। दस मिनट रखने के लिए एक घंटे की रिकॉर्डिंग साफ़ करना छह गुना ज़्यादा ख़र्च है। पहले काटिए, फिर उस हिस्से को साफ़ कीजिए जो रखते हैं।
फ़िल्टर फिर पुनर्निर्माण, या उल्टा, दुगनी अच्छी सफ़ाई नहीं देता: दूसरा मॉडल पहले से बदली आवाज़ पर काम करता है और उसकी ख़ामियाँ बढ़ाता है। एक ही बार, कान से चुना हुआ।
नॉइज़ रिमूवर वह हटाता है जो आवाज़ नहीं है; वह तीन मीटर दूर रखे माइक को पास नहीं लाता। गूँज और दूरी रहती हैं। जो सुनेंगे वह वही आवाज़ है, आसपास के शोर के बिना।
नॉइज़ रिमूवर से गुज़री कॉन्सर्ट रिकॉर्डिंग आवाज़ के साथ और बैंड के बिना निकलती है: वाद्यों को शोर माना जाता है। गाने के लिए ट्रैक सेपरेशन चाहिए, सफ़ाई नहीं।
लगभग हमेशा पहले फ़िल्टर: वह आवाज़ को दोबारा लिखे बिना शोर हटाता है। पुनर्निर्माण तब जब शोर आवाज़ से तेज़ था, या नतीजे को संगीत में घुलना है, क्योंकि सूखा टिंबर बेहतर मिलता है।
नहीं, और यह जान-बूझकर है। दोनों मॉडल आवाज़ रखते हैं और बाक़ी फेंक देते हैं: गाने में संगीत को शोर माना जाता है। गाने को ट्रैकों में बाँटने के लिए गाने से आवाज़ अलग करें वर्कफ़्लो Demucs से यह काम करता है।
दोनों आवाज़ें रहती हैं, दोनों मॉडल वक्ताओं में फ़र्क़ नहीं करते। जो जाता है वह उनके बीच का शोर है, उनमें से कोई एक नहीं। सिर्फ़ एक आवाज़ रखने के लिए कैटलॉग के दूसरे नोड SAM Audio को बताना पड़ता है कि आप क्या ढूँढ रहे हैं।
DeepFilterNet 3 नौ क्रेडिट प्रति मिनट, ElevenLabs आइसोलेशन चौदह। डेमो का मेमो, दोनों नोड में चौदह सेकंड, छह क्रेडिट का है। क़ीमत क्लिक से पहले नोड पर दिखती है, आपकी फ़ाइल की मापी गई अवधि पर।
एक बार में दस मिनट। लंबी रिकॉर्डिंग मोंटाज में टुकड़ों में कटती है, या सिर्फ़ उन हिस्सों पर साफ़ होती है जो आप रखते हैं, जो वैसे भी सस्ता है।
फ़िल्टर नहीं: वह हटाता है, कुछ जोड़ता नहीं। पुनर्निर्माण थोड़ा: वह जो पहचाना उससे आवाज़ दोबारा लिखता है, और सीटी जैसे व्यंजनों पर यह सुनाई दे सकता है। इसीलिए डेमो दोनों दिखाता है।
हाँ, दो चरणों में: मोंटाज साउंडट्रैक एक्सपोर्ट करता है, नोड उसे साफ़ करता है, और साफ़ आवाज़ पुरानी की जगह तस्वीरों पर वापस बैठ जाती है।
नहीं। जो आप अपलोड करते हैं वह आपके वर्कस्पेस में रहता है और किसी ट्रेनिंग को नहीं सौंपा जाता, और यह सवाल यहाँ कहीं और से ज़्यादा भारी है: अक्सर बात इंटरव्यू और क़रीबी लोगों की आवाज़ों की होती है।
AI से रिकॉर्डिंग साफ़ करें
यह वर्कफ़्लो इस्तेमाल करेंमुफ़्त अकाउंट, बिना क्रेडिट कार्ड। वर्कफ़्लो आपके कैनवास में पहले से भरा हुआ खुलता है।