誕生日メッセージ
お祝いする本人の写真と、温かみのあるボイスで読み上げた20語のテキスト:これがデモの2つ目の例です。動画はそのままメッセージで送信でき、誰も自分を撮影する必要がありません。
顔写真とカタログのボイスで読み上げたテキストがあれば、InfiniTalkが人物を話らせます。唇の動き、まばたき、頭の動きも含めて。動画の長さはボイスの長さそのまま。ワークフロー全体をアカウントなしで確認できます。
本物のワークフロー、本物の結果。自由に移動・ズームできます。
このワークフローを使う実際のワークフロー:Mediaノードに写真を1枚、Voice-overノードで読み上げた2つのテキスト、そしてInfiniTalkに設定した2つのVideoノードが、imageポートで写真を、voiceポートでボイスを受け取ります。
概要
写真1枚で十分です。動画を撮る必要もアバターを設定する必要もありません。写真の中の顔が話し始め、唇は一音節ごとに動き、まばたきや、話す時の小さな頭の動きも伴います。仕上がりはカメラの前で撮影したかのように見えますが、元はスマートフォンの肖像写真です。
テキストはVoice-overノードで、カタログのボイス(まずElevenLabs v3)かクローンされたボイスで読み上げられます。InfiniTalkに設定したVideoノードが写真とボイスを受け取り、音声とちょうど同じ長さ(最大28秒)の動画を生成します。価格はファイルで計測されたこの長さに応じて決まり、クリックする前に表示されます。
これは話すアバターと同じ動作ですが、元になるのはあなた自身の顔、生成されたキャラクター、描かれたマスコット、あるいは古い肖像写真です。誕生日メッセージ、製品プレゼン、SNSでの告知など、デモでは同じ写真に2つのメッセージを表示しています。
正面を向いた写真を選びます
顔が鮮明で、口が閉じていて見える状態、正面からの光、シンプルな背景であること。スマートフォンの肖像写真で十分です。メガネやひげは問題ありませんが、口を手で覆っていたり横顔だったりするのはNGです。
テキストを書き、ボイスを選びます
Voice-overノードが、選んだボイスであなたの言語で書いた内容を読み上げます。20語程度の文で7〜8秒になります。まずボイスを生成してください:これが動画の長さと価格を決めます。
動画を生成します
InfiniTalkノードには、計測されたボイスの長さと正確な価格が表示されます。クリックすると顔が話し始めます。SNS向けなら480p、投影用のレンダリングなら720pです。
テキストが長い場合はつなぎます
ボイスが28秒を超える場合は、テキストを2回分に分けて、他の動画ワークフローと同様にMontageノードで無料でつなぎ合わせてください。
同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。
お祝いする本人の写真と、温かみのあるボイスで読み上げた20語のテキスト:これがデモの2つ目の例です。動画はそのままメッセージで送信でき、誰も自分を撮影する必要がありません。
生成された肖像がプレゼンターになります:発表用のテキストをVoice-overノードに、写真をMediaノードに入れれば、720pの動画が出力され、製品ページやUGC広告にすぐ使えます。
スキャンした家族写真と一人称で書いたテキスト:顔が動き出し、話し始めます。小さかったり劣化していたりする場合は、まずEnhanceノードを通し、その後InfiniTalkに通してください。
口がはっきり見える描かれたキャラクターも問題なく動きます:モデルは写真の唇と同じように、イラストの唇もアニメーション化します。カタログの明るいボイスと組み合わせれば、SNSでのブランド告知に最適です。
写真1枚、3言語分のVoice-overノード3つ、InfiniTalkノード3つ:同じ人物が英語、スペイン語、フランス語を話し、毎回唇の動きも正確です。すでに撮影済みの動画から始めたい場合は、吹き替えをご覧ください。
生成した動画を写真を踊らせる、またはリファレンスとしてVideoノードに通してください:まず話す、次に体が動きます。
モデルは口全体を見る必要があります。正面またはやや斜めであれば同期は正確ですが、横顔では唇が歪んでしまいます。
歯を見せた笑顔、あごに手を当てている、マイクが前にある、こういったものはすべて障害になります。口を閉じ、顔をしっかり見せることで、仕上がりがきれいになります。
InfiniTalkノードのプロンプトは態度を説明するものであり、テキストではありません。人物が話す内容は接続したボイスによって決まります。テキストはVoice-overノードに書いてください。
28秒を超えると、ノードは生成前に拒否し、課金は発生しません。2回分に分けて、Montageノードでつなぎ合わせてください。
1回の生成につき2秒から28秒まで、通常の速さでおよそ60語分です。動画の長さは接続したボイスの長さとちょうど同じで、特に設定する必要はありません。
はい。Mediaノードに録音をアップロードしてvoiceポートに接続するか、Voice-overノードで自分の声をクローンして、どんなテキストでも読み上げさせることができます。
どちらでも構いません。Imageノードで生成した肖像、描かれたマスコット、古い写真も、顔が正面を向いていて口が見えていれば、セルフィーと同じくらい上手く話します。
いいえ。価格は生成開始時に確保され、技術的な失敗の場合は自動的に返却されます。正確な金額はクリックする前にボタン上に表示されます。
話すアバターは、Veo上で一度に、その声を持つ架空のプレゼンターを生成します。こちらは、あなた自身の写真が、選んだ声で話し、キャラクターを再生成せずにテキストだけを変更できます。
はい、Voice-overノードで選べます:ElevenLabsのボイスは14の言語を読み上げます。リップシンクは言語を問わず音そのものに従います。
InfiniTalkは写真に近いフレームで、480pまたは720pで出力します。特定の比率が必要な場合は、9:16、1:1、16:9に対応したMontageノードで後からリフレームしてください。
1つのノードにつき1人です。対話にしたい場合は、写真2枚をそれぞれ別のボイスで話らせて、Montageノードでカットを交互に組み合わせてください。