ツール一覧へ

AIで写真を話らせる

顔写真とカタログのボイスで読み上げたテキストがあれば、InfiniTalkが人物を話らせます。唇の動き、まばたき、頭の動きも含めて。動画の長さはボイスの長さそのまま。ワークフロー全体をアカウントなしで確認できます。

インタラクティブデモ

本物のワークフロー、本物の結果。自由に移動・ズームできます。

このワークフローを使う

実際のワークフロー:Mediaノードに写真を1枚、Voice-overノードで読み上げた2つのテキスト、そしてInfiniTalkに設定した2つのVideoノードが、imageポートで写真を、voiceポートでボイスを受け取ります。

概要

ワークフローの成果物
動画2本(18秒・480p・1:1) · ナレーション2本
キャンバスの構成
8個のノードを6本の接続でつないだ構成
使用モデル
ElevenLabs v3, InfiniTalk
1回のフル実行のコスト
約446クレジット($5.35)

写真1枚で十分です。動画を撮る必要もアバターを設定する必要もありません。写真の中の顔が話し始め、唇は一音節ごとに動き、まばたきや、話す時の小さな頭の動きも伴います。仕上がりはカメラの前で撮影したかのように見えますが、元はスマートフォンの肖像写真です。

テキストはVoice-overノードで、カタログのボイス(まずElevenLabs v3)かクローンされたボイスで読み上げられます。InfiniTalkに設定したVideoノードが写真とボイスを受け取り、音声とちょうど同じ長さ(最大28秒)の動画を生成します。価格はファイルで計測されたこの長さに応じて決まり、クリックする前に表示されます。

これは話すアバターと同じ動作ですが、元になるのはあなた自身の顔、生成されたキャラクター、描かれたマスコット、あるいは古い肖像写真です。誕生日メッセージ、製品プレゼン、SNSでの告知など、デモでは同じ写真に2つのメッセージを表示しています。

手順

  1. 1

    正面を向いた写真を選びます

    顔が鮮明で、口が閉じていて見える状態、正面からの光、シンプルな背景であること。スマートフォンの肖像写真で十分です。メガネやひげは問題ありませんが、口を手で覆っていたり横顔だったりするのはNGです。

  2. 2

    テキストを書き、ボイスを選びます

    Voice-overノードが、選んだボイスであなたの言語で書いた内容を読み上げます。20語程度の文で7〜8秒になります。まずボイスを生成してください:これが動画の長さと価格を決めます。

  3. 3

    動画を生成します

    InfiniTalkノードには、計測されたボイスの長さと正確な価格が表示されます。クリックすると顔が話し始めます。SNS向けなら480p、投影用のレンダリングなら720pです。

  4. 4

    テキストが長い場合はつなぎます

    ボイスが28秒を超える場合は、テキストを2回分に分けて、他の動画ワークフローと同様にMontageノードで無料でつなぎ合わせてください。

バリエーションと活用例

同じキャンバスを、別の用途に合わせて調整。各バリエーションは、プロンプトを2〜3行変えるだけです。

誕生日メッセージ

お祝いする本人の写真と、温かみのあるボイスで読み上げた20語のテキスト:これがデモの2つ目の例です。動画はそのままメッセージで送信でき、誰も自分を撮影する必要がありません。

撮影なしの製品プレゼン

生成された肖像がプレゼンターになります:発表用のテキストをVoice-overノードに、写真をMediaノードに入れれば、720pの動画が出力され、製品ページやUGC広告にすぐ使えます。

物語を語る古い肖像写真

スキャンした家族写真と一人称で書いたテキスト:顔が動き出し、話し始めます。小さかったり劣化していたりする場合は、まずEnhanceノードを通し、その後InfiniTalkに通してください。

告知するマスコット

口がはっきり見える描かれたキャラクターも問題なく動きます:モデルは写真の唇と同じように、イラストの唇もアニメーション化します。カタログの明るいボイスと組み合わせれば、SNSでのブランド告知に最適です。

3言語で同じメッセージ

写真1枚、3言語分のVoice-overノード3つ、InfiniTalkノード3つ:同じ人物が英語、スペイン語、フランス語を話し、毎回唇の動きも正確です。すでに撮影済みの動画から始めたい場合は、吹き替えをご覧ください。

話す写真、そして動く写真

生成した動画を写真を踊らせる、またはリファレンスとしてVideoノードに通してください:まず話す、次に体が動きます。

よくある失敗

横顔や斜め45度に近い写真

モデルは口全体を見る必要があります。正面またはやや斜めであれば同期は正確ですが、横顔では唇が歪んでしまいます。

写真の中で口が開いていたり隠れていたりする

歯を見せた笑顔、あごに手を当てている、マイクが前にある、こういったものはすべて障害になります。口を閉じ、顔をしっかり見せることで、仕上がりがきれいになります。

Videoノードにテキストを書いてしまう

InfiniTalkノードのプロンプトは態度を説明するものであり、テキストではありません。人物が話す内容は接続したボイスによって決まります。テキストはVoice-overノードに書いてください。

1回の生成に対して長すぎるボイス

28秒を超えると、ノードは生成前に拒否し、課金は発生しません。2回分に分けて、Montageノードでつなぎ合わせてください。

おすすめモデル

よくある質問

写真はどのくらいの時間話せますか?

1回の生成につき2秒から28秒まで、通常の速さでおよそ60語分です。動画の長さは接続したボイスの長さとちょうど同じで、特に設定する必要はありません。

自分の声を使えますか?

はい。Mediaノードに録音をアップロードしてvoiceポートに接続するか、Voice-overノードで自分の声をクローンして、どんなテキストでも読み上げさせることができます。

自分の写真が必要ですか、それとも生成されたキャラクターでもいいですか?

どちらでも構いません。Imageノードで生成した肖像、描かれたマスコット、古い写真も、顔が正面を向いていて口が見えていれば、セルフィーと同じくらい上手く話します。

生成に失敗した場合も課金されますか?

いいえ。価格は生成開始時に確保され、技術的な失敗の場合は自動的に返却されます。正確な金額はクリックする前にボタン上に表示されます。

話すアバターとの違いは何ですか?

話すアバターは、Veo上で一度に、その声を持つ架空のプレゼンターを生成します。こちらは、あなた自身の写真が、選んだ声で話し、キャラクターを再生成せずにテキストだけを変更できます。

言語を選べますか?

はい、Voice-overノードで選べます:ElevenLabsのボイスは14の言語を読み上げます。リップシンクは言語を問わず音そのものに従います。

動画は16:9ですか、それとも縦型ですか?

InfiniTalkは写真に近いフレームで、480pまたは720pで出力します。特定の比率が必要な場合は、9:16、1:1、16:9に対応したMontageノードで後からリフレームしてください。

複数の人物を話らせることはできますか?

1つのノードにつき1人です。対話にしたい場合は、写真2枚をそれぞれ別のボイスで話らせて、Montageノードでカットを交互に組み合わせてください。

AIで写真を話らせる

このワークフローを使う

無料アカウント、クレジットカード不要。ワークフローは入力済みの状態でキャンバスに開きます。