Поздравление с днём рождения
Фото именинника, текст из двадцати слов, озвученный тёплым голосом: это второй пример в демо. Видео отправляется как есть в сообщении, и никому не пришлось снимать себя на видео.
Фото лица и текст, озвученный голосом из каталога: InfiniTalk заставляет человека говорить, включая губы, моргания и движения головы. Видео длится столько, сколько длится голос. Весь воркфлоу виден без регистрации.
Настоящий воркфлоу, реальные результаты. Двигайте холст и приближайте как угодно.
Использовать этот воркфлоуРеальный воркфлоу: фото в ноде «Медиа», два текста, каждый озвучен своей нодой «Голос за кадром», и две ноды «Видео», настроенные на InfiniTalk, которые получают фото через порт изображения и голос через порт голоса.
Коротко
Достаточно одного фото. Не нужно снимать видео, не нужно настраивать аватар: лицо на фото начинает говорить, губы точно попадают в каждый слог, добавляются моргания, небольшие движения головы, сопровождающие фразу. Результат смотрится как съёмка на камеру, а получен он из портрета, снятого на телефон.
Текст озвучивается в ноде «Голос за кадром» одним из голосов каталога (в первую очередь ElevenLabs v3) или клонированным голосом. Нода «Видео», настроенная на InfiniTalk, получает фото и голос и создаёт видео, которое длится ровно столько, сколько длится аудио, до двадцати восьми секунд. Цена зависит от этой длительности, измеренной по файлу, и отображается до нажатия на кнопку.
Это тот же приём, что и в говорящем аватаре, но здесь используется ВАШЕ лицо, лицо сгенерированного персонажа, нарисованного талисмана или старого портрета. Поздравление с днём рождения, презентация продукта, объявление в соцсетях: в демо показаны два сообщения на одном и том же фото.
Выберите фото, снятое лицом к камере
Чёткое лицо, закрытый и видимый рот, свет спереди, простой фон. Портрет с телефона отлично подойдёт. Очки и борода не мешают, а рука перед ртом или снимок в профиль не годятся.
Напишите текст и выберите голос
Нода «Голос за кадром» озвучивает то, что вы написали, выбранным голосом, на вашем языке. Фраза из двадцати слов занимает семь-восемь секунд. Сначала сгенерируйте голос: именно он определяет длительность и цену видео.
Сгенерируйте видео
Нода InfiniTalk показывает измеренную длительность голоса и точную цену. Нажмите: лицо начинает говорить, в 480p для соцсетей или в 720p для показа на большом экране.
Соединяйте, если текст длинный
Если голос длиннее двадцати восьми секунд, разбейте текст на два дубля и смонтируйте их подряд в ноде «Монтаж», бесплатно, как и в других видео-воркфлоу.
Тот же холст, настроенный под разные задачи: в каждом варианте меняются две-три строки промпта.
Фото именинника, текст из двадцати слов, озвученный тёплым голосом: это второй пример в демо. Видео отправляется как есть в сообщении, и никому не пришлось снимать себя на видео.
Сгенерированный портрет превращается в презентующего: текст запуска в ноде «Голос за кадром», фото в ноде «Медиа», а видео выходит в 720p, готовое для страницы продукта или UGC-рекламы.
Отсканированное семейное фото, текст, написанный от первого лица: лицо оживает и начинает говорить. Если фото маленькое или повреждённое, сначала пропустите его через ноду «Улучшение», а затем через InfiniTalk.
Нарисованный персонаж с чётко видимым ртом отлично подходит: модель анимирует губы рисунка так же, как и губы на фото. Идеально для объявления бренда в соцсетях с жизнерадостным голосом из каталога.
Одно фото, три ноды «Голос за кадром» на трёх языках, три ноды InfiniTalk: один и тот же человек говорит на английском, испанском и французском, и губы каждый раз точно совпадают. Если у вас уже есть готовое видео, посмотрите дубляж.
Возьмите готовое видео и пропустите его через оживление фото в танце или через ноду «Видео» в качестве референса: сначала речь, потом движение.
Модели нужно видеть весь рот. При виде спереди или в лёгком три четверти синхронизация чистая; в профиль губы искажаются.
Улыбка с видимыми зубами, рука на подбородке, микрофон перед лицом: всё это мешает. Закрытый рот, открытое лицо, и результат получится чётким.
Промпт ноды InfiniTalk описывает поведение, а не текст. То, что говорит человек, определяется подключённым голосом: текст пишется в ноде «Голос за кадром».
Если длительность превышает двадцать восемь секунд, нода отказывается генерировать без списания средств. Разбейте на два дубля и соедините их в ноде «Монтаж».
От двух до двадцати восьми секунд за одну генерацию, это около шестидесяти слов в обычном темпе. Видео длится ровно столько, сколько подключённый голос: ничего настраивать не нужно.
Да. Загрузите запись в ноду «Медиа» и подключите её к порту голоса, либо клонируйте свой голос в ноде «Голос за кадром» и озвучьте им любой текст.
Подойдёт и то, и другое. Портрет, сгенерированный нодой «Изображение», нарисованный талисман или старая фотография говорят так же хорошо, как и селфи, если лицо смотрит прямо в камеру и рот виден.
Нет. Сумма резервируется при запуске и автоматически возвращается при технической ошибке. Точная сумма отображается на кнопке перед нажатием.
Говорящий аватар создаёт придуманного презентующего с его голосом за один раз, на базе Veo. Здесь же говорит ВАШЕ фото, голосом по вашему выбору, и текст можно менять без повторной генерации персонажа.
Да, в ноде «Голос за кадром»: голоса ElevenLabs озвучивают текст на четырнадцати языках. Синхронизация губ следует за звуками независимо от языка.
InfiniTalk создаёт кадр, близкий к пропорциям фото, в 480p или 720p. Для точного формата обрежьте видео впоследствии в ноде «Монтаж», которая поддерживает 9:16, 1:1 и 16:9.
Один человек на ноду. Для диалога сделайте два фото, каждое со своим голосом, а затем чередуйте кадры в ноде «Монтаж».
Как заставить фото говорить с помощью ИИ
Использовать этот воркфлоуБесплатный аккаунт, без банковской карты. Воркфлоу откроется уже заполненным на вашем холсте.