月額プランが10%オフ、コードNODE10で8月31日まで

Imaginode
ツール一覧へ

話すAIアバター

合成のプレゼンターがカメラに向かってあなたの台本を、自分の声で話します。Veo 3.1が映像と音声を同時に生成するので、口の動きがぴったり合います。ワークフローをアカウントなしでここで見られます。

インタラクティブデモ

本物のワークフロー、本物の結果。自由に移動・ズームできます。

このワークフローを使う

リファレンスカードが顔を、テキストノードが台本を支え、動画ノードが声付きの8秒をレンダリングします。ナレーションノードはありません。声は動画モデルから出力されます。ノードを開いてプロンプトを読んでください。

概要

ワークフローの成果物
画像1枚(9:16) · 動画1本(8秒・720p・9:16)
キャンバスの構成
5個のノードを2本の接続でつないだ構成
使用モデル
Seedream 5 Pro, Veo 3.1 Fast
1回のフル実行のコスト
約149クレジット(€1.49)

話すアバターは常に同じ問題にぶつかります。リップシンクです。従来のチェーンは無音の動画を生成し、別の場所で声を作り、あとから貼り合わせようとします。すると0.1秒のずれが残り、それだけで一瞬で嘘くさくなります。

ここでは声と映像が同じレンダリングから出力されます。Veo 3.1 Fastがセリフを動画と一緒に生成します。唇が声に合うのは、両方が一緒に計算されたからです。その代わり、一語変えるにはレンダリングのやり直しが必要です。だから台本は実行前に確定させます。そのために台本は独自のテキストノードに置かれていて、キャラクターに触れずに編集できます。

顔のほうは3アングルのリファレンスカードが支えます。複数ショットで一貫したキャラクターを保つのと同じ仕組みです。これにより、同じプレゼンターでシリーズ全体を、エピソードごとに作り続けられます。Seedream 5 Proが最初のショットを構成し、公開料金計算ツールで登録前に1テイクの正確なコストがわかります。

手順

  1. 1

    プレゼンターを作る

    リファレンスカードには顔の3つのビューを入れます。次のエピソードで、別の背景と別のテキストでも、まったく同じ人物を呼び出せるのはこのカードのおかげです。

  2. 2

    ショットを構成する

    画像ノードがシーンをフレーミングします。デスク、照明、画面上のテキスト用の余白。胸から上のショットを少しオフセットして構えると、手のジェスチャーのための空間が生まれます。

  3. 3

    セリフを書く

    テキストノードには演出とセリフを引用符付きで書きます。8秒なら短い2文で十分です。トーンは演技指導のように記述します。

  4. 4

    テイクをレンダリングする

    8秒、縦型フォーマット、音声オン。声は動画ファイルの中に入っています。後から同期させるものは何もなく、テイクが良ければ編集も不要です。

バリエーションと活用例

同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。

研修用のプレゼンターアバター

研修モジュールは8秒のシーケンスに分割し、それぞれ動画ノードに入れ、すべて同じ顔のシートに接続します。プレゼンターは章をまたいで同一のまま:実写の撮り直しでは、この価格で保証できないことです。

ブランドのスポークスパーソン

会社のすべての動画を同じ顔が開きます。社員の予定にも退職にも左右されません。服装と背景は画像ノードに書きましょう:シートが顔を、ショットが文脈を受け持ちます。

別の言語を話すアバター

セリフを引用符で目的の言語で書けば、Veo 3.1 Fastが唇の動きまで含めて発音します。同じ動画が、同じプレゼンターと5つのセリフで、5つの市場に展開できます。

サイトのウェルカム動画

8秒、バストショット、ぼかしたオフィス背景:トップページの滞在時間を伸ばすフォーマットです。フレーズは短く、1動画に1メッセージ、無音再生のための字幕も忘れずに。

TikTokとReels向けの縦型アバター

テンプレートは最初から9:16でレンダリングします。画面上のテキスト用に頭の上に余白を残し、編集で最初の0.5秒をカットしましょう:動画モデルは冒頭がやや固まりがちです。

よくある失敗

8秒に対して長すぎる台本

1テイクに収まるのは短い2文です。それ以上はモデルが早口になるか末尾を切り、一語直すために全体を再課金することになります。

レンダリング開始後に声を指定する

声は映像と同じレンダリングから出てきます:声質、話速、意図は生成前にプロンプトで指定します。声の変更は新しいテイクを意味します。

顔に寄りすぎたクローズアップ

極端に寄ったショットは口元の微細な欠点を際立たせます。バストショットで少しオフセットすれば、身振りの余地が生まれ、テイクの説得力が増します。

おすすめモデル

よくある質問

声は選べますか?

キャスティング指示のようにプロンプトで記述します。声質、話す速さ、意図。リストから選ぶのではなく、同じテキストの2つのレンダリングは少し違うことがあります。

モデルは日本語を話せますか?

はい。プロンプト内で話させたいセリフを日本語で引用符に入れて書いてください。説明部分は英語のままでも、話される言語には影響しません。

テイクを失敗したら?

やり直します。8秒のテイクはクレジットで数十円程度で、ノードは過去のレンダリング履歴を保持します。2つのバージョンを比較しても何も失われません。

リップシンクの精度はどのくらいですか?

正確です。映像と音声が同じレンダリングから出るため、後から貼り合わせるものが何もないからです。0.1秒のずれで合成だとばれる従来のチェーンとの違いは、そこにあります。

自分の顔をアバターにできますか?

はい、リファレンスシートにあなたの写真を3枚入れます。必ず本人の同意がある顔だけで行ってください:第三者の写真から作ったスポークスパーソンは、肖像権の深刻な問題になります。

8秒のテイク1本の費用は?

Veo 3.1 Fastで約144クレジット、約1.4ユーロで、開始画像も込みです。正確な価格はレンダリング開始前にボタンに表示されます。

複数のセリフをつなげられますか?

はい、セリフごとに動画ノードを1つ、すべて同じ顔のシートと同じ開始ショットに接続します。順番につなげば、一貫したプレゼンターによる1分の動画になります。

話すAIアバター

このワークフローを使う

無料アカウント、クレジットカード不要。ワークフローは入力済みの状態でキャンバスに開きます。