ツール一覧へ

AIで動画を吹き替える、唇の動きも同期

誰かが話している動画に、別の言語の新しい声を当てる。Sync Lipsync 3が新しいテキストに合わせて唇のタイミングを再調整します。同じ映像を英語版とスペイン語版で、撮り直しなしに。ワークフロー全体はアカウントなしでご覧いただけます。

インタラクティブデモ

本物のワークフロー、本物の結果。自由に移動・ズームできます。

このワークフローを使う

実際のワークフロー:アバターの動画をMediaノードに入れ、2つの翻訳文をそれぞれVoice-overノードで読み上げ、Sync Lipsync 3に設定した2つのVideoノードが動画を映像ポートで、声を音声ポートで受け取ります。

概要

ワークフローの成果物
動画2本(12秒・720p・9:16) · ナレーション2本
キャンバスの構成
8個のノードを6本の接続でつないだ構成
使用モデル
ElevenLabs v3, Sync Lipsync 3
1回のフル実行のコスト
約208クレジット($2.50)

一度撮影した動画を、必要な数の言語に展開する。それがリップシンク吹き替えでできることです。画面の人物は元のセリフではなく翻訳文を話し、その口はフレームごとに新しい声に合わせて動きます。顔、照明、フレーミングは撮影時のままです。

翻訳したテキストはVoice-overノードで読み上げます。カタログの音声でも、クローンした音声、たとえばあなた自身の声でも構いません。Sync Lipsync 3に設定したVideoノードが動画と声を受け取り、吹き替え済みの映像を書き出します。料金は生成される長さに応じて、2つのファイルから算出され、クリックする前に表示されます。

デモでは、話すアバターの動画(フランス語)から始めて、英語版、続いてスペイン語版を作ります。CM、社内研修動画、製品紹介:撮影は一度、市場ごとに1本のファイルです。

手順

  1. 1

    話している動画をアップロードします

    正面を向いた顔で、照明が十分にあり、口が見えていて、手やマイクが前に入っていないもの。1回の処理で最大2分まで。スマートフォンで撮影した映像でも問題ありません。

  2. 2

    翻訳文を書き、声を選びます

    各Voice-overノードが1つの言語のテキストを読み上げます。人物に近い声を選ぶか、本人の声をクローンして言語が変わっても声色を保ちましょう。

  3. 3

    長さの合わせ方を設定します

    デフォルトでは、2つのうち短い方の長さで結果が終わります。声が映像より長い場合は「ループ」を選びましょう。声の下で映像が繰り返され、カメラ目線の映像ではうまくいきます。

  4. 4

    生成して比較します

    言語ごとに1ノード、すべて同じ動画に接続します。それぞれの料金はその長さに応じます。気に入らない言語だけ再生成すれば十分です。

バリエーションと活用例

同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。

5言語版のCM

フランス語で撮影した広告が5本のファイルになります。言語ごとにVoice-overノードを1つ、Sync Lipsync 3ノードを1つ、入力には同じ動画を使います。予算はボタンごとに、実行前に確認できます。

翻訳した研修動画

カメラ目線で撮影した講師の動画、Textノードで翻訳したテキスト、それをVoice-overノードで読み上げ、海外拠点のチーム向けに吹き替えます。編集内容はそのまま変わりません。

撮り直さずにセリフを修正する

吹き替えは同じ言語でも使えます。言い間違えたセリフ、変更になった価格、修正したい名前。テキストを書き直して再生成すれば、口の動きがそれに追従します。

字幕付きのお客様の声を、さらに吹き替える

本物の証言は、その人の顔を失わずに海外の視聴者に届けられます。近い声で吹き替え、アクセシビリティのために字幕はそのまま残しましょう。

生成したアバターをすべての言語で

話すアバターUGC広告で作った動画を出発点にして吹き替えましょう。合成キャラクターは、映像を作り直さずにあらゆる言語を話せます。

動画ではなく写真から

元になる動画がない場合は、写真をしゃべらせる方法があります。InfiniTalkがポートレートと声から顔の動きを作り出します。

よくある失敗

複数の顔が映っている動画

このモデルは1つの顔だけを同期します。画面に2人が映っていると、結果は予測できません。話している人物にフレームを絞りましょう。

映像よりずっと長い声

カットモードでは、映像の終わりで結果も終わり、テキストの後半が消えてしまいます。翻訳文を短くするか、ループモードに切り替えましょう。

撮影中に口が隠れている

手、マイク、カップ:口の前を通るものはすべて、その部分のフレームで同期を崩します。撮影時は顔を隠さないようにしましょう。

音楽や環境音を忘れる

結果には声しか含まれません。音楽はMontageノードで戻し入れましょう。そうしなければ、吹き替え版が元の映像より寂しく聞こえてしまいます。

おすすめモデル

よくある質問

言語ごとに撮り直しが必要ですか?

いいえ、それがこの仕組みの肝です。動画は1本だけ、言語ごとにVoice-overノードを用意すれば、唇はそれぞれの翻訳文に追従します。

元の声は残りますか?

いいえ、結果の音声トラックは接続した声になります。音楽や環境音を残したい場合は、吹き替え済みの動画の上にMontageノードで重ねてください。

自分の声で別の言語に吹き替えできますか?

できます。Voice-overノードで自分の声をクローンし、翻訳文を書けば、クローンした声がそれを読み上げます。唇はそれに追従します。

受け付けられる動画の長さは?

1回の処理につき1秒から2分まで。それより長い場合は、Montageノードで動画を分割し、それぞれを吹き替えてください。

動画の吹き替えにはいくらかかりますか?

料金は生成される長さに応じて秒単位で計算され、動画と声を接続した時点でボタンに表示されます。技術的な失敗の場合は自動的に返金されます。

AIが生成した動画にも吹き替えは使えますか?

使えます、実写と同様に。Wan、Seedance、Veoなどで生成した、顔が正面を向いた映像であれば、どんな動画と同じように吹き替えられます。

身振りや表情は保たれますか?

保たれます。再計算されるのは口だけです。手、眉、頭の動きは元の映像のままです。

説得力のある吹き替えにはどんな声を選ぶべきですか?

人物と同じ音域の声、あるいはその人のクローンを選びましょう。同期を実行する前に、Voice-overノードで声だけを聞いて確認してください。

AIで動画を吹き替える、唇の動きも同期

このワークフローを使う

無料アカウント、クレジットカード不要。ワークフローは入力済みの状態でキャンバスに開きます。