5言語版のCM
フランス語で撮影した広告が5本のファイルになります。言語ごとにVoice-overノードを1つ、Sync Lipsync 3ノードを1つ、入力には同じ動画を使います。予算はボタンごとに、実行前に確認できます。
誰かが話している動画に、別の言語の新しい声を当てる。Sync Lipsync 3が新しいテキストに合わせて唇のタイミングを再調整します。同じ映像を英語版とスペイン語版で、撮り直しなしに。ワークフロー全体はアカウントなしでご覧いただけます。
本物のワークフロー、本物の結果。自由に移動・ズームできます。
このワークフローを使う実際のワークフロー:アバターの動画をMediaノードに入れ、2つの翻訳文をそれぞれVoice-overノードで読み上げ、Sync Lipsync 3に設定した2つのVideoノードが動画を映像ポートで、声を音声ポートで受け取ります。
概要
一度撮影した動画を、必要な数の言語に展開する。それがリップシンク吹き替えでできることです。画面の人物は元のセリフではなく翻訳文を話し、その口はフレームごとに新しい声に合わせて動きます。顔、照明、フレーミングは撮影時のままです。
翻訳したテキストはVoice-overノードで読み上げます。カタログの音声でも、クローンした音声、たとえばあなた自身の声でも構いません。Sync Lipsync 3に設定したVideoノードが動画と声を受け取り、吹き替え済みの映像を書き出します。料金は生成される長さに応じて、2つのファイルから算出され、クリックする前に表示されます。
デモでは、話すアバターの動画(フランス語)から始めて、英語版、続いてスペイン語版を作ります。CM、社内研修動画、製品紹介:撮影は一度、市場ごとに1本のファイルです。
話している動画をアップロードします
正面を向いた顔で、照明が十分にあり、口が見えていて、手やマイクが前に入っていないもの。1回の処理で最大2分まで。スマートフォンで撮影した映像でも問題ありません。
翻訳文を書き、声を選びます
各Voice-overノードが1つの言語のテキストを読み上げます。人物に近い声を選ぶか、本人の声をクローンして言語が変わっても声色を保ちましょう。
長さの合わせ方を設定します
デフォルトでは、2つのうち短い方の長さで結果が終わります。声が映像より長い場合は「ループ」を選びましょう。声の下で映像が繰り返され、カメラ目線の映像ではうまくいきます。
生成して比較します
言語ごとに1ノード、すべて同じ動画に接続します。それぞれの料金はその長さに応じます。気に入らない言語だけ再生成すれば十分です。
同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。
フランス語で撮影した広告が5本のファイルになります。言語ごとにVoice-overノードを1つ、Sync Lipsync 3ノードを1つ、入力には同じ動画を使います。予算はボタンごとに、実行前に確認できます。
カメラ目線で撮影した講師の動画、Textノードで翻訳したテキスト、それをVoice-overノードで読み上げ、海外拠点のチーム向けに吹き替えます。編集内容はそのまま変わりません。
吹き替えは同じ言語でも使えます。言い間違えたセリフ、変更になった価格、修正したい名前。テキストを書き直して再生成すれば、口の動きがそれに追従します。
本物の証言は、その人の顔を失わずに海外の視聴者に届けられます。近い声で吹き替え、アクセシビリティのために字幕はそのまま残しましょう。
話すアバターやUGC広告で作った動画を出発点にして吹き替えましょう。合成キャラクターは、映像を作り直さずにあらゆる言語を話せます。
元になる動画がない場合は、写真をしゃべらせる方法があります。InfiniTalkがポートレートと声から顔の動きを作り出します。
このモデルは1つの顔だけを同期します。画面に2人が映っていると、結果は予測できません。話している人物にフレームを絞りましょう。
カットモードでは、映像の終わりで結果も終わり、テキストの後半が消えてしまいます。翻訳文を短くするか、ループモードに切り替えましょう。
手、マイク、カップ:口の前を通るものはすべて、その部分のフレームで同期を崩します。撮影時は顔を隠さないようにしましょう。
結果には声しか含まれません。音楽はMontageノードで戻し入れましょう。そうしなければ、吹き替え版が元の映像より寂しく聞こえてしまいます。
いいえ、それがこの仕組みの肝です。動画は1本だけ、言語ごとにVoice-overノードを用意すれば、唇はそれぞれの翻訳文に追従します。
いいえ、結果の音声トラックは接続した声になります。音楽や環境音を残したい場合は、吹き替え済みの動画の上にMontageノードで重ねてください。
できます。Voice-overノードで自分の声をクローンし、翻訳文を書けば、クローンした声がそれを読み上げます。唇はそれに追従します。
1回の処理につき1秒から2分まで。それより長い場合は、Montageノードで動画を分割し、それぞれを吹き替えてください。
料金は生成される長さに応じて秒単位で計算され、動画と声を接続した時点でボタンに表示されます。技術的な失敗の場合は自動的に返金されます。
使えます、実写と同様に。Wan、Seedance、Veoなどで生成した、顔が正面を向いた映像であれば、どんな動画と同じように吹き替えられます。
保たれます。再計算されるのは口だけです。手、眉、頭の動きは元の映像のままです。
人物と同じ音域の声、あるいはその人のクローンを選びましょう。同期を実行する前に、Voice-overノードで声だけを聞いて確認してください。