ריאיון בטלפון
מקרה הלימוד: שני אנשים בבית קפה, הטלפון מונח ביניהם. המסנן מסיר את הכוסות ומכונת הקפה, שני הקולות נשארים, עם המרחק שבא איתם. הרצה אחת בדרך כלל מספיקה.
הודעה קולית שהוקלטה במרפסת רועשת, מועברת דרך שני מסירי הרעש של הקטלוג זה לצד זה, DeepFilterNet 3 ו-ElevenLabs Audio Isolation. כל התהליך גלוי בלי חשבון.
workflow אמיתי, תוצאות אמיתיות. הזיזו והתקרבו כרצונכם.
שימוש ב-workflow הזהתהליך אמיתי: אותה הודעה רועשת נכנסת לשתי צמתים של שיפור צליל, ואתם שומעים מה כל אחת הסירה.
בקצרה
ריאיון שהוקלט בטלפון בבית קפה, הודעה קולית שהוקלטה ברחוב, קול פודקאסט עם המקרר מאחור: רעש הרקע הוא מה שמפריד בין הקלטה שמישה להקלטה שצריך לעשות מחדש. התהליך הזה מסיר אותו עם שני המודלים בקטלוג שיודעים לעשות זאת, ומניח אותם זה לצד זה כי הם לא עובדים אותו דבר.
DeepFilterNet 3 הוא מסנן: הוא מסיר את מה שאינו קול ומשאיר את אוויר החדר, והתוצאה נשארת טבעית. ElevenLabs Audio Isolation בונה את הקול מחדש: יבש יותר, רדיופוני יותר, לפעמים מעט סינתטי בעיצורים. בהודעת ההדגמה, שנבנתה בכוונה מערבוב קול נקי עם אווירת רחוב וזמזום, אנחנו יודעים בדיוק מה היה להסיר.
הקובץ שלכם נכנס דרך כפתור הייבוא של הצומת, עד עשר דקות בכל הרצה, והמחיר נספר לפי שנייה: שני הניקויים על ארבע עשרה שניות עולים 7 סנט, ו-DeepFilterNet לבדו יוצא תשעה קרדיטים לדקה.
ייבאו את ההקלטה
MP3, WAV, M4A או OGG, עד עשר דקות. הצומת קוראת את האורך ומציגה את המחיר לפני כל לחיצה. גם שמע שנוצר במקום אחר על הקנבס מתחבר ליציאה.
הריצו את המסנן
DeepFilterNet 3 קודם: הוא הזול ביותר והנאמן ביותר. אם הקול יוצא צלול והחדר עדיין שם, סיימתם.
נסו את הבנייה מחדש
אם הרעש היה חזק, או אם הקול צריך לשבת על מוזיקה, הריצו את הבידוד לצידו. הוא יוצא יבש יותר, וזה מתערבב טוב יותר בעריכה.
האזינו לעיצורים
שם השניים נפרדים: צלילי ס ו-ת הם מה שמסיר רעש פוגע בו ראשון. הקובץ המנצח הולך לעריכה או מורד מהצומת.
אותו קנבס, מכוון לצרכים שונים: כל וריאציה מסתכמת בשתיים-שלוש שורות פרומפט להחלפה.
מקרה הלימוד: שני אנשים בבית קפה, הטלפון מונח ביניהם. המסנן מסיר את הכוסות ומכונת הקפה, שני הקולות נשארים, עם המרחק שבא איתם. הרצה אחת בדרך כלל מספיקה.
המקרר, הרחוב דרך החלון, מאוורר המחשב: רעש קבוע ורך שהמסנן מסיר בלי להשאיר עקבות. בקול קרוב למיקרופון, DeepFilterNet הוא מה שצריך, הבנייה מחדש תהיה יותר מדי.
הודעת ההדגמה. רעש חזק ומשתנה, מכוניות ועוברי אורח. המסנן משאיר שכבה, הבנייה מחדש מוחקת אותה: כאן היא מנצחת, כי רוצים להבין, לא לשמור את האווירה.
קריינות שצולמה בלי אולפן, להנחה על תמונות ומוזיקה. תוצאת הבידוד, היבשה יותר, מתערבבת בעריכה טוב יותר מקול שעדיין גורר את החדר מאחוריו.
קלטת שעברה דיגיטציה, עם הרחש והזמזום שלה. המסנן מסיר את הרחש ושומר את הקול כפי שהיה, וזה מה שרוצים מזיכרון: צלול, לא כתוב מחדש.
קול רחוק, הדהוד, שיעולים. שניהם מנקים את הרעש; אף אחד לא מקצר את הדהוד האולם, שאינו רעש אלא חלל. צפו לקול צלול אך עדיין רחוק.
המחיר נספר לפי שנייה. לנקות שעה של הקלטה כדי לשמור עשר דקות עולה פי שישה יותר מדי. חתכו קודם, נקו אחר כך, את הקטע שאתם שומרים.
המסנן ואז הבנייה מחדש, או להפך, לא נותנים ניקוי טוב פי שניים: המודל השני עובד על קול שכבר עבר שינוי ומעצים את הפגמים שלו. הרצה אחת, שנבחרה באוזן.
מסיר רעש מסיר את מה שאינו הקול; הוא לא מקרב מיקרופון שהיה במרחק שלושה מטרים. ההדהוד והמרחק נשארים. מה שתשמעו הוא אותו קול, בלי הרעש סביבו.
הקלטת הופעה שעברה במסיר רעש יוצאת עם הקול ובלי הלהקה: הכלים נחשבים רעש. לשיר צריך הפרדה לערוצים, לא ניקוי.
המסנן קודם, כמעט תמיד: הוא מסיר את הרעש בלי לכתוב את הקול מחדש. הבנייה מחדש כשהרעש היה חזק מהקול, או כשהתוצאה צריכה להיטמע במוזיקה, כי גוון יבש יותר מתערבב טוב יותר.
לא, ובכוונה. שני המודלים שומרים את הקול וזורקים את השאר: בשיר, המוזיקה נחשבת רעש. כדי להפריד שיר לערוצים, התהליך להפריד שירה משיר עושה את העבודה עם Demucs.
שני הקולות נשמרים, שני המודלים לא מבחינים בין דוברים. מה שהולך הוא הרעש ביניהם, לא אחד מהם. כדי לשמור קול אחד בלבד, צריך לתאר ל-SAM Audio, צומת אחרת בקטלוג, את מה שמחפשים.
DeepFilterNet 3 יוצא תשעה קרדיטים לדקה, הבידוד של ElevenLabs ארבעה עשר. הודעת ההדגמה, ארבע עשרה שניות בשתי הצמתים, עולה שישה קרדיטים. המחיר מוצג על הצומת לפני הלחיצה, על האורך הנמדד של הקובץ שלכם.
עשר דקות בכל הרצה. הקלטה ארוכה יותר נחתכת לחלקים בעריכה, או מנוקה רק בקטעים שאתם שומרים, מה שממילא זול יותר.
המסנן, לא: הוא מסיר, לא מוסיף דבר. הבנייה מחדש, מעט: היא כותבת את הקול מחדש ממה שזיהתה, ובעיצורים שורקים אפשר לשמוע זאת. לכן ההדגמה מראה את שניהם.
כן, בשני שלבים: העריכה מייצאת את פס הקול, הצומת מנקה אותו, והקול הנקי חוזר לשבת על התמונות במקום הישן.
לא. מה שאתם מעלים נשאר במרחב שלכם ואינו נמסר לשום אימון, והשאלה כבדה כאן יותר מבמקומות אחרים: לרוב מדובר בריאיונות ובקולות של קרובים.
לנקות הקלטה בעזרת בינה מלאכותית
שימוש ב-workflow הזהחשבון חינמי, בלי כרטיס אשראי. ה-workflow נפתח מוכן מראש בקנבס שלכם.