모든 도구

AI로 사진을 말하게 하기

얼굴 사진 한 장과 카탈로그 목소리로 읽는 텍스트만 있으면, InfiniTalk가 그 사람을 말하게 만듭니다. 입술, 눈 깜빡임, 고개 움직임까지 포함해서요. 영상 길이는 목소리 길이만큼입니다. 전체 워크플로우는 계정 없이도 확인할 수 있습니다.

인터랙티브 데모

실제 워크플로, 실제 결과물. 자유롭게 이동하고 확대해 보세요.

이 워크플로 사용하기

실제 워크플로우: 사진 한 장을 Media 노드에 넣고, 두 개의 텍스트를 각각 Voice-over 노드로 읽게 한 다음, InfiniTalk로 설정된 두 개의 Video 노드가 image 포트로 사진을, voice 포트로 목소리를 받습니다.

한눈에 보기

이 워크플로의 결과물
480p, 1:1 포맷의 18초 영상 2개 · 내레이션 2개
캔버스 구조
노드 8개, 연결선 6개
연결된 모델
ElevenLabs v3, InfiniTalk
전체 1회 실행 비용
약 446 크레딧, US$5.35 상당

사진 한 장이면 충분합니다. 촬영할 영상도, 설정할 아바타도 필요 없습니다. 사진 속 얼굴이 말을 시작하며, 입술은 한 음절 한 음절에 맞춰 움직이고, 눈을 깜빡이고, 문장에 맞는 작은 고개 움직임까지 함께합니다. 결과물은 카메라를 정면으로 바라보고 찍은 영상처럼 보이지만, 실제로는 휴대폰 초상화 사진에서 나온 것입니다.

텍스트는 Voice-over 노드에서 카탈로그의 목소리 중 하나(ElevenLabs v3가 대표적) 또는 클로닝된 목소리로 읽힙니다. InfiniTalk로 설정된 Video 노드가 사진과 목소리를 받아, 오디오와 정확히 같은 길이의 영상을 최대 28초까지 만들어 냅니다. 가격은 파일에서 측정된 이 길이에 따라 정해지며, 클릭 전에 미리 표시됩니다.

이것은 말하는 아바타와 같은 동작이지만, 당신의 얼굴, 생성된 캐릭터, 그려진 마스코트, 오래된 초상화로도 할 수 있습니다. 생일 메시지, 제품 소개, 소셜미디어 공지 등, 데모에서는 같은 사진으로 두 개의 메시지를 보여 줍니다.

이렇게 하세요

  1. 1

    정면 사진을 선택하세요

    얼굴이 선명하고, 입이 닫혀 있으면서 잘 보이고, 정면 조명, 단순한 배경. 휴대폰 초상화 사진이면 충분히 잘 됩니다. 안경과 수염은 괜찮지만, 입을 가린 손이나 옆모습은 안 됩니다.

  2. 2

    텍스트를 쓰고 목소리를 선택하세요

    Voice-over 노드가 선택한 목소리로, 사용하는 언어로 텍스트를 읽습니다. 20단어 문장은 7~8초 정도입니다. 목소리를 먼저 생성하세요: 이 목소리가 영상의 길이와 가격을 결정합니다.

  3. 3

    영상을 생성하세요

    InfiniTalk 노드에 측정된 목소리 길이와 정확한 가격이 표시됩니다. 클릭하면 얼굴이 말을 시작합니다. 소셜미디어용은 480p, 상영용 렌더링은 720p로 만들 수 있습니다.

  4. 4

    텍스트가 길다면 이어서 연결하세요

    목소리가 28초를 넘으면, 텍스트를 두 개의 테이크로 나누고 Montage 노드에서 무료로 이어 붙이세요. 다른 영상 워크플로우와 같은 방식입니다.

변형과 활용 사례

같은 캔버스를 다른 목적에 맞게 조정한 버전들: 각 변형은 프롬프트 두세 줄만 바꾸면 됩니다.

생일 메시지

축하받는 사람의 사진과 따뜻한 목소리로 읽는 20단어 텍스트: 이것이 데모의 두 번째 예시입니다. 영상은 그대로 메시지로 전송되고, 아무도 직접 촬영할 필요가 없었습니다.

촬영 없는 제품 소개

생성된 초상화가 발표자가 됩니다: 출시 문구를 Voice-over 노드에, 사진을 Media 노드에 넣으면, 720p 영상이 나와 제품 페이지나 UGC 광고에 바로 쓸 수 있습니다.

이야기하는 오래된 초상화

스캔한 가족 사진, 1인칭으로 쓴 텍스트: 얼굴이 살아나 말을 합니다. 사진이 작거나 손상되었다면 먼저 Enhance 노드를 거친 다음 InfiniTalk에 넣으세요.

공지하는 마스코트

입 모양이 뚜렷한 캐릭터 그림도 잘 됩니다: 모델은 사진의 입술처럼 그림의 입술도 애니메이션합니다. 활기찬 카탈로그 목소리와 함께, 소셜미디어 브랜드 공지에 적합합니다.

세 가지 언어로 같은 메시지

사진 한 장, 세 가지 언어의 Voice-over 노드 세 개, InfiniTalk 노드 세 개: 같은 사람이 영어, 스페인어, 프랑스어로 말하며, 매번 입술이 정확히 맞습니다. 이미 촬영된 영상으로 시작하려면 더빙을 참고하세요.

말하다가 움직이는 사진

완성된 영상을 사진 춤추게 하기나 참조용 Video 노드에 넣으세요: 말은 먼저, 몸의 움직임은 그다음입니다.

자주 하는 실수

옆모습이거나 너무 좁은 4분의 3 각도

모델은 입 전체를 봐야 합니다. 정면이나 살짝 4분의 3 각도라면 립싱크가 깨끗하게 되지만, 옆모습에서는 입술이 왜곡됩니다.

사진에서 입이 열려 있거나 가려짐

이가 보이는 미소, 턱에 얹은 손, 앞을 가로막은 마이크 모두 방해가 됩니다. 입을 닫고 얼굴을 잘 드러내면 결과가 깨끗합니다.

Video 노드에 텍스트를 쓰는 것

InfiniTalk 노드의 프롬프트는 태도를 묘사하는 것이지, 텍스트가 아닙니다. 사람이 말하는 내용은 연결된 목소리이며, 텍스트는 Voice-over 노드에 넣어야 합니다.

한 번에 처리하기엔 너무 긴 목소리

28초를 넘으면 노드가 생성 전에 거부하며, 요금이 청구되지 않습니다. 두 개의 테이크로 나누고 Montage 노드에서 이어 붙이세요.

추천 모델

자주 묻는 질문

사진이 얼마나 오래 말할 수 있나요?

생성당 2초에서 28초까지, 보통 속도로는 약 60단어 정도입니다. 영상 길이는 연결된 목소리 길이와 정확히 같습니다. 따로 설정할 것이 없습니다.

제 목소리를 사용할 수 있나요?

네. 녹음 파일을 Media 노드에 업로드해서 voice 포트에 연결하거나, Voice-over 노드에서 목소리를 클로닝해서 원하는 텍스트를 읽게 할 수 있습니다.

제 사진이 필요한가요, 아니면 생성된 캐릭터도 되나요?

둘 다 가능합니다. Image 노드로 생성한 초상화, 그려진 마스코트, 오래된 사진도 셀카만큼 잘 작동합니다. 얼굴이 정면을 향하고 입이 보이기만 하면 됩니다.

생성이 실패하면 요금이 청구되나요?

아니요. 가격은 실행 시 예약되며, 기술적 오류가 발생하면 자동으로 반환됩니다. 정확한 금액은 클릭 전에 버튼에 표시됩니다.

말하는 아바타와 어떤 차이가 있나요?

말하는 아바타는 가상의 발표자와 목소리를 한 번에 Veo로 생성합니다. 여기서는 당신의 사진이 원하는 목소리로 말하며, 텍스트는 캐릭터를 다시 생성하지 않고도 바꿀 수 있습니다.

언어를 선택할 수 있나요?

네, Voice-over 노드에서요: ElevenLabs 목소리는 14개 언어를 읽습니다. 립싱크는 언어와 관계없이 소리를 따라갑니다.

영상은 16:9인가요, 세로형인가요?

InfiniTalk는 사진과 비슷한 비율의 화면을 480p 또는 720p로 렌더링합니다. 정확한 비율이 필요하면 이후 Montage 노드에서 리프레임하세요. 9:16, 1:1, 16:9를 지원합니다.

여러 사람을 말하게 할 수 있나요?

노드당 한 사람입니다. 대화를 만들려면 두 사진이 각자의 목소리로 말하게 한 다음, Montage 노드에서 장면을 교차 편집하세요.

AI로 사진을 말하게 하기

이 워크플로 사용하기

무료 계정, 카드 등록 불필요. 워크플로가 미리 채워진 상태로 캔버스에 열립니다.