휴대폰으로 한 인터뷰
교과서적인 경우입니다. 카페의 두 사람 사이에 놓인 휴대폰. 필터가 컵과 커피 머신을 걷어내고 두 목소리는 거리감과 함께 남습니다. 대개 한 번이면 됩니다.
시끄러운 테라스에서 녹음한 음성 메모를 카탈로그의 두 잡음 제거 모델, DeepFilterNet 3와 ElevenLabs Audio Isolation에 나란히 통과시킵니다. 계정 없이 전체 워크플로를 그대로 볼 수 있습니다.
실제 워크플로, 실제 결과물. 자유롭게 이동하고 확대해 보세요.
이 워크플로 사용하기실제 워크플로: 같은 잡음 섞인 메모가 두 개의 소리 개선 노드로 들어가고, 각각이 무엇을 걷어냈는지 들을 수 있습니다.
한눈에 보기
카페에서 휴대폰으로 녹음한 인터뷰, 길에서 녹음한 음성 메모, 뒤에서 냉장고가 도는 팟캐스트 목소리. 배경 소음이야말로 쓸 수 있는 녹음과 다시 해야 하는 녹음을 가릅니다. 이 워크플로는 그 일을 할 줄 아는 카탈로그의 두 모델로 소음을 걷어내고, 일하는 방식이 다르기에 둘을 나란히 놓습니다.
DeepFilterNet 3는 필터입니다. 목소리가 아닌 것을 걷어내고 방의 공기는 남겨 결과가 자연스럽습니다. ElevenLabs Audio Isolation은 목소리를 다시 만듭니다. 더 건조하고, 라디오 같고, 자음에서 가끔 약간 인공적입니다. 데모의 메모는 깨끗한 목소리에 거리 소음과 험 노이즈를 섞어 일부러 만든 것이라, 무엇을 빼야 했는지 정확히 압니다.
파일은 노드의 가져오기 버튼으로 들어가고, 한 번에 최대 10분, 값은 초 단위입니다. 14초에 두 번의 정리로 7센트, DeepFilterNet만이면 분당 9크레딧입니다.
녹음을 가져오세요
MP3, WAV, M4A, OGG, 최대 10분. 노드가 길이를 읽고 클릭 전에 값을 보여 줍니다. 캔버스의 다른 곳에서 만든 오디오도 포트에 연결됩니다.
필터를 실행하세요
DeepFilterNet 3 먼저. 가장 싸고 가장 충실합니다. 목소리가 또렷하게 나오고 방의 느낌이 남아 있으면 끝입니다.
재구성을 시도하세요
소음이 컸거나 목소리를 음악 위에 올려야 한다면 옆에서 Isolation을 실행하세요. 더 건조하게 나와 편집에서 더 잘 섞입니다.
자음을 들으세요
둘이 갈리는 곳이 거기입니다. ㅅ과 ㅌ 소리는 잡음 제거가 가장 먼저 망가뜨리는 것입니다. 이긴 파일을 편집으로 보내거나 노드에서 내려받습니다.
같은 캔버스를 다른 목적에 맞게 조정한 버전들: 각 변형은 프롬프트 두세 줄만 바꾸면 됩니다.
교과서적인 경우입니다. 카페의 두 사람 사이에 놓인 휴대폰. 필터가 컵과 커피 머신을 걷어내고 두 목소리는 거리감과 함께 남습니다. 대개 한 번이면 됩니다.
냉장고, 창밖의 거리, 컴퓨터 팬. 일정하고 부드러운 소음이라 필터가 흔적 없이 걷어냅니다. 마이크에 가까운 목소리라면 DeepFilterNet이 맞고, 재구성은 지나칩니다.
데모의 메모입니다. 크고 변하는 소음, 차와 행인. 필터는 얇은 층을 남기고 재구성은 지웁니다. 여기서는 재구성이 이깁니다. 분위기가 아니라 내용을 알아듣고 싶으니까요.
스튜디오 없이 찍은 내레이션을 영상과 음악 위에 올릴 때. 더 건조한 Isolation의 결과가 방의 울림을 끌고 다니는 목소리보다 편집에서 더 잘 섞입니다.
디지털로 옮긴 카세트, 그 히스와 험 노이즈. 필터는 히스를 걷어내고 목소리는 있던 그대로 남깁니다. 추억에 바라는 것이 그것입니다. 또렷하되 다시 쓰이지 않은 것.
먼 목소리, 잔향, 기침. 둘 다 소음은 걷어내지만 어느 쪽도 홀의 잔향은 줄이지 않습니다. 잔향은 소음이 아니라 공간이니까요. 또렷하지만 여전히 먼 목소리를 기대하세요.
값은 초 단위입니다. 10분을 남기려고 한 시간을 정리하면 여섯 배를 냅니다. 먼저 자르고, 남길 구간만 정리하세요.
필터 뒤에 재구성, 또는 그 반대를 해도 두 배로 깨끗해지지 않습니다. 두 번째 모델은 이미 변형된 목소리에 작용해 그 흠을 키웁니다. 귀로 고른 한 번이면 됩니다.
잡음 제거는 목소리가 아닌 것을 걷어낼 뿐, 3미터 떨어져 있던 마이크를 가까이 가져오지 않습니다. 잔향과 거리는 남습니다. 들리는 것은 같은 목소리에서 주변 소음을 뺀 것입니다.
콘서트 녹음을 잡음 제거에 통과시키면 목소리만 남고 밴드가 사라집니다. 악기가 소음으로 취급되기 때문입니다. 노래에 필요한 것은 트랙 분리이지 정리가 아닙니다.
거의 언제나 필터 먼저입니다. 목소리를 다시 쓰지 않고 소음을 걷어냅니다. 재구성은 소음이 목소리보다 컸을 때, 또는 결과가 음악에 녹아들어야 할 때입니다. 더 건조한 음색이 더 잘 섞이기 때문입니다.
안 됩니다. 의도된 것입니다. 두 모델은 목소리를 남기고 나머지를 버립니다. 노래에서는 음악이 소음으로 취급됩니다. 노래를 트랙으로 나누려면 노래에서 보컬 분리하기 워크플로가 Demucs로 그 일을 합니다.
두 목소리 다 남습니다. 두 모델 모두 화자를 구별하지 않습니다. 사라지는 것은 둘 사이의 소음이지 둘 중 하나가 아닙니다. 한 목소리만 남기려면 카탈로그의 다른 노드 SAM Audio에 찾는 것을 글로 설명해야 합니다.
DeepFilterNet 3는 분당 9크레딧, ElevenLabs Isolation은 14입니다. 데모의 메모는 14초를 두 노드에 넣어 6크레딧입니다. 값은 클릭 전에 노드에 표시되며 파일의 측정된 길이로 계산됩니다.
한 번에 10분입니다. 더 긴 녹음은 편집에서 조각내거나 남길 구간만 정리합니다. 어차피 그쪽이 더 쌉니다.
필터는 아닙니다. 빼기만 하고 더하지 않습니다. 재구성은 조금 바뀝니다. 인식한 것으로 목소리를 다시 쓰기에 치찰음에서 들릴 수 있습니다. 그래서 데모가 둘 다 보여 줍니다.
있습니다. 두 단계입니다. 편집이 음성 트랙을 내보내고, 노드가 그것을 정리하고, 깨끗한 목소리가 옛 소리 대신 영상 위로 돌아갑니다.
아닙니다. 올린 것은 당신의 작업 공간에 남고 어떤 학습에도 넘어가지 않습니다. 여기서는 인터뷰와 가까운 사람의 목소리를 다루는 일이 많은 만큼 이 질문은 더 무겁습니다.