スマートフォンで録ったインタビュー
教科書的な例。カフェの二人のあいだにスマートフォンを置く。フィルターがカップとコーヒーマシンを取り除き、二人の声は距離感ごと残ります。たいてい一回で足ります。
騒がしいテラスで吹き込んだ音声メモを、カタログの二つのノイズ除去、DeepFilterNet 3 と ElevenLabs Audio Isolation に並べて通します。アカウント登録なしで、ワークフロー全体をそのまま見られます。
本物のワークフロー、本物の結果。自由に移動・ズームできます。
このワークフローを使う実際のワークフロー:同じ雑音入りメモが二つの「音を改善」ノードに入り、それぞれが何を取り除いたかが聴けます。
概要
カフェでスマートフォンに録ったインタビュー、路上で吹き込んだ音声メモ、冷蔵庫の音が後ろに入ったポッドキャストの声。雑音こそが、使える録音と録り直す録音を分けます。このワークフローは、それができるカタログ内の二つのモデルで雑音を取り除き、働き方が違うので二つを並べて見せます。
DeepFilterNet 3 はフィルターです。声でないものを取り除き、部屋の空気は残すので、結果は自然なままです。ElevenLabs Audio Isolation は声を作り直します。より乾いて、よりラジオ的で、子音がときどき少し合成っぽくなります。デモのメモはきれいな声に街のざわめきとハム音を混ぜてわざと作ったものなので、何を取り除くべきだったかが正確に分かっています。
あなたのファイルはノードの読み込みボタンから入り、一回につき最長十分、価格は秒単位です。十四秒に対する二つのクリーニングで7セント、DeepFilterNet 単体なら一分あたり9クレジットです。
録音を読み込む
MP3、WAV、M4A、OGG、最長十分。ノードは長さを読み取り、クリックの前に価格を表示します。キャンバスの別の場所で作った音声もポートにつなげます。
フィルターを実行する
まず DeepFilterNet 3。いちばん安く、いちばん忠実です。声がはっきり出て部屋の気配が残っていれば、それで完了です。
再構築を試す
雑音が大きかったとき、あるいは声を音楽の上に載せるときは、隣で Isolation を実行してください。より乾いた声が出て、編集でよく馴染みます。
子音を聴く
二つの差はそこに出ます。サ行やタ行の音は、ノイズ除去が最初に傷めるものです。勝ったファイルを編集へ送るか、ノードからダウンロードします。
同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。
教科書的な例。カフェの二人のあいだにスマートフォンを置く。フィルターがカップとコーヒーマシンを取り除き、二人の声は距離感ごと残ります。たいてい一回で足ります。
冷蔵庫、窓の外の通り、パソコンのファン。一定で柔らかい雑音で、フィルターが跡形もなく取り除きます。マイクに近い声なら DeepFilterNet で十分、再構築はやりすぎです。
デモのメモです。大きく変動する雑音、車と通行人。フィルターは薄い層を残し、再構築はそれを消します。ここでは再構築の勝ちです。雰囲気を残すのではなく、内容を理解したいからです。
スタジオなしで撮ったナレーションを、映像と音楽の上に載せる。Isolation の結果は乾いているので、部屋の響きを引きずった声より編集でよく馴染みます。
デジタル化したカセット、ヒスノイズとハム音つき。フィルターはヒスを取り除き、声はそのまま残します。思い出に求めるのはそれです。鮮明で、書き換えられていないこと。
遠い声、残響、咳。どちらも雑音は取り除きますが、どちらも会場の残響は短くしません。残響は雑音ではなく空間だからです。鮮明だが遠いままの声を想定してください。
価格は秒単位です。十分を残すために一時間分をきれいにすれば、六倍払うことになります。先に切って、残す箇所だけをきれいにしてください。
フィルターの後に再構築、あるいはその逆をしても、二倍きれいにはなりません。二つ目のモデルはすでに変換された声に対して働き、そのアーティファクトを強調します。耳で選んだ一回だけです。
ノイズ除去は声でないものを取り除くだけで、三メートル離れていたマイクを近づけはしません。残響と距離は残ります。聴こえるのは同じ声から周囲の雑音を除いたものです。
コンサートの録音をノイズ除去に通すと、声だけが残ってバンドが消えます。楽器が雑音として扱われるからです。曲に必要なのはパート分離であって、クリーニングではありません。
ほぼいつも、まずフィルターです。声を書き換えずに雑音を取り除きます。再構築は、雑音が声より大きかったとき、あるいは結果を音楽に溶け込ませたいときに。乾いた音色のほうがよく混ざるからです。
効きません。意図的です。二つのモデルは声を残して残りを捨てます。曲では音楽が雑音として扱われます。曲をパートに分けるなら、曲からボーカルを分離するのワークフローが Demucs でその仕事をします。
二人の声は両方残ります。どちらのモデルも話者を区別しません。消えるのは二人のあいだの雑音で、どちらかの声ではありません。一人の声だけを残すには、カタログの別ノード SAM Audio に探しているものを文章で伝えます。
DeepFilterNet 3 は一分あたり9クレジット、ElevenLabs の Isolation は14です。デモのメモは十四秒を二つのノードに通して6クレジットです。価格はクリック前にノードに表示され、ファイルの測定された長さで計算されます。
一回につき十分です。それより長い録音は編集で分割するか、残す箇所だけをきれいにします。そのほうがどのみち安く済みます。
フィルターでは変わりません。取り除くだけで、何も足しません。再構築では少し変わります。認識したものから声を書き直すので、歯擦音で聞き取れることがあります。だからデモは両方を見せています。
できます。二段階です。編集で音声トラックを書き出し、ノードでそれをきれいにし、きれいな声を古い音声の代わりに映像へ戻します。
使われません。アップロードしたものはあなたの領域に留まり、学習には渡されません。ここではインタビューや身近な人の声を扱うことが多いだけに、この問いはなおさら重いはずです。