Все инструменты

Как заставить фото говорить с помощью ИИ

Фото лица и текст, озвученный голосом из каталога: InfiniTalk заставляет человека говорить, включая губы, моргания и движения головы. Видео длится столько, сколько длится голос. Весь воркфлоу виден без регистрации.

Интерактивное демо

Настоящий воркфлоу, реальные результаты. Двигайте холст и приближайте как угодно.

Использовать этот воркфлоу

Реальный воркфлоу: фото в ноде «Медиа», два текста, каждый озвучен своей нодой «Голос за кадром», и две ноды «Видео», настроенные на InfiniTalk, которые получают фото через порт изображения и голос через порт голоса.

Коротко

Что выдаёт воркфлоу
2 видео по 18 с в 480p, формат 1:1 · 2 закадровых голоса
Структура холста
8 нод, связанных 6 соединениями
Подключённые модели
ElevenLabs v3, InfiniTalk
Стоимость полного прогона
около 446 кредитов, то есть 5,35 $

Достаточно одного фото. Не нужно снимать видео, не нужно настраивать аватар: лицо на фото начинает говорить, губы точно попадают в каждый слог, добавляются моргания, небольшие движения головы, сопровождающие фразу. Результат смотрится как съёмка на камеру, а получен он из портрета, снятого на телефон.

Текст озвучивается в ноде «Голос за кадром» одним из голосов каталога (в первую очередь ElevenLabs v3) или клонированным голосом. Нода «Видео», настроенная на InfiniTalk, получает фото и голос и создаёт видео, которое длится ровно столько, сколько длится аудио, до двадцати восьми секунд. Цена зависит от этой длительности, измеренной по файлу, и отображается до нажатия на кнопку.

Это тот же приём, что и в говорящем аватаре, но здесь используется ВАШЕ лицо, лицо сгенерированного персонажа, нарисованного талисмана или старого портрета. Поздравление с днём рождения, презентация продукта, объявление в соцсетях: в демо показаны два сообщения на одном и том же фото.

Как это сделать

  1. 1

    Выберите фото, снятое лицом к камере

    Чёткое лицо, закрытый и видимый рот, свет спереди, простой фон. Портрет с телефона отлично подойдёт. Очки и борода не мешают, а рука перед ртом или снимок в профиль не годятся.

  2. 2

    Напишите текст и выберите голос

    Нода «Голос за кадром» озвучивает то, что вы написали, выбранным голосом, на вашем языке. Фраза из двадцати слов занимает семь-восемь секунд. Сначала сгенерируйте голос: именно он определяет длительность и цену видео.

  3. 3

    Сгенерируйте видео

    Нода InfiniTalk показывает измеренную длительность голоса и точную цену. Нажмите: лицо начинает говорить, в 480p для соцсетей или в 720p для показа на большом экране.

  4. 4

    Соединяйте, если текст длинный

    Если голос длиннее двадцати восьми секунд, разбейте текст на два дубля и смонтируйте их подряд в ноде «Монтаж», бесплатно, как и в других видео-воркфлоу.

Варианты и сценарии использования

Тот же холст, настроенный под разные задачи: в каждом варианте меняются две-три строки промпта.

Поздравление с днём рождения

Фото именинника, текст из двадцати слов, озвученный тёплым голосом: это второй пример в демо. Видео отправляется как есть в сообщении, и никому не пришлось снимать себя на видео.

Презентация продукта без съёмок

Сгенерированный портрет превращается в презентующего: текст запуска в ноде «Голос за кадром», фото в ноде «Медиа», а видео выходит в 720p, готовое для страницы продукта или UGC-рекламы.

Старый портрет, который рассказывает историю

Отсканированное семейное фото, текст, написанный от первого лица: лицо оживает и начинает говорить. Если фото маленькое или повреждённое, сначала пропустите его через ноду «Улучшение», а затем через InfiniTalk.

Талисман, который делает объявление

Нарисованный персонаж с чётко видимым ртом отлично подходит: модель анимирует губы рисунка так же, как и губы на фото. Идеально для объявления бренда в соцсетях с жизнерадостным голосом из каталога.

Одно и то же сообщение на трёх языках

Одно фото, три ноды «Голос за кадром» на трёх языках, три ноды InfiniTalk: один и тот же человек говорит на английском, испанском и французском, и губы каждый раз точно совпадают. Если у вас уже есть готовое видео, посмотрите дубляж.

Фото, которое сначала говорит, а потом двигается

Возьмите готовое видео и пропустите его через оживление фото в танце или через ноду «Видео» в качестве референса: сначала речь, потом движение.

Частые ошибки

Лицо в профиль или в тесном три четверти

Модели нужно видеть весь рот. При виде спереди или в лёгком три четверти синхронизация чистая; в профиль губы искажаются.

Открытый или закрытый рот на фото

Улыбка с видимыми зубами, рука на подбородке, микрофон перед лицом: всё это мешает. Закрытый рот, открытое лицо, и результат получится чётким.

Написание текста в ноде «Видео»

Промпт ноды InfiniTalk описывает поведение, а не текст. То, что говорит человек, определяется подключённым голосом: текст пишется в ноде «Голос за кадром».

Слишком длинный голос для одного прохода

Если длительность превышает двадцать восемь секунд, нода отказывается генерировать без списания средств. Разбейте на два дубля и соедините их в ноде «Монтаж».

Рекомендуемые модели

Частые вопросы

Сколько времени может говорить фото?

От двух до двадцати восьми секунд за одну генерацию, это около шестидесяти слов в обычном темпе. Видео длится ровно столько, сколько подключённый голос: ничего настраивать не нужно.

Можно ли использовать свой собственный голос?

Да. Загрузите запись в ноду «Медиа» и подключите её к порту голоса, либо клонируйте свой голос в ноде «Голос за кадром» и озвучьте им любой текст.

Нужно ли фото именно меня, или подойдёт сгенерированный персонаж?

Подойдёт и то, и другое. Портрет, сгенерированный нодой «Изображение», нарисованный талисман или старая фотография говорят так же хорошо, как и селфи, если лицо смотрит прямо в камеру и рот виден.

Взимается ли плата, если генерация не удалась?

Нет. Сумма резервируется при запуске и автоматически возвращается при технической ошибке. Точная сумма отображается на кнопке перед нажатием.

Чем это отличается от говорящего аватара?

Говорящий аватар создаёт придуманного презентующего с его голосом за один раз, на базе Veo. Здесь же говорит ВАШЕ фото, голосом по вашему выбору, и текст можно менять без повторной генерации персонажа.

Можно ли выбрать язык?

Да, в ноде «Голос за кадром»: голоса ElevenLabs озвучивают текст на четырнадцати языках. Синхронизация губ следует за звуками независимо от языка.

Видео получается в формате 16:9 или вертикальное?

InfiniTalk создаёт кадр, близкий к пропорциям фото, в 480p или 720p. Для точного формата обрежьте видео впоследствии в ноде «Монтаж», которая поддерживает 9:16, 1:1 и 16:9.

Можно ли заставить говорить нескольких людей?

Один человек на ноду. Для диалога сделайте два фото, каждое со своим голосом, а затем чередуйте кадры в ноде «Монтаж».

Как заставить фото говорить с помощью ИИ

Использовать этот воркфлоу

Бесплатный аккаунт, без банковской карты. Воркфлоу откроется уже заполненным на вашем холсте.