Semua tool

Membuat Foto Berbicara dengan AI

Sebuah foto wajah dan teks yang dibacakan oleh suara dari katalog: InfiniTalk membuat orang tersebut berbicara, lengkap dengan gerakan bibir, kedipan mata, dan gerakan kepala. Durasi video mengikuti durasi suara. Seluruh workflow bisa dilihat tanpa perlu akun.

Demo interaktif

Workflow sungguhan, hasil nyata. Geser dan zoom sesuka Anda.

Gunakan workflow ini

Workflow sebenarnya: satu foto di node Media, dua teks yang masing-masing dibacakan oleh node Voice-over, dan dua node Video yang diatur pada InfiniTalk, menerima foto melalui port image dan suara melalui port voice.

Sekilas info

Apa yang dihasilkan workflow ini
2 video berdurasi 18 detik dalam 480p, format 1:1 · 2 sulih suara
Struktur canvas
8 node terhubung oleh 6 sambungan
Model yang terpasang
ElevenLabs v3, InfiniTalk
Biaya satu kali proses lengkap
sekitar 446 kredit, setara US$5,35

Satu foto saja sudah cukup. Tidak perlu merekam video, tidak perlu mengatur avatar: wajah pada foto mulai berbicara, dengan bibir yang tersinkron pada setiap suku kata, kedipan mata, gerakan kecil kepala yang menyertai sebuah kalimat. Hasilnya terlihat seperti pengambilan gambar langsung ke kamera, padahal berasal dari potret ponsel.

Teks dibacakan di node Voice-over, dengan salah satu suara dari katalog (ElevenLabs v3 sebagai andalan) atau suara yang dikloning. Node Video yang diatur pada InfiniTalk menerima foto dan suara, lalu menghasilkan video yang durasinya persis sama dengan durasi audio, hingga dua puluh delapan detik. Harga mengikuti durasi tersebut, diukur dari berkas suara, dan ditampilkan sebelum Anda mengklik.

Ini adalah konsep avatar berbicara, tetapi dari wajah ANDA sendiri, atau dari karakter yang dihasilkan AI, maskot yang digambar, atau potret lama. Pesan ulang tahun, presentasi produk, pengumuman di media sosial: demo ini menampilkan dua pesan pada foto yang sama.

Cara melakukannya

  1. 1

    Pilih foto yang menghadap kamera

    Wajah tajam, mulut tertutup dan terlihat jelas, cahaya dari depan, latar sederhana. Potret dari ponsel sudah sangat cocok. Kacamata dan janggut tidak masalah, tetapi tangan menutupi mulut atau tampak samping tidak disarankan.

  2. 2

    Tulis teks dan pilih suara

    Node Voice-over membacakan apa yang Anda tulis dengan suara yang dipilih, dalam bahasa Anda. Kalimat dua puluh kata memakan waktu tujuh hingga delapan detik. Hasilkan suara terlebih dahulu: suara inilah yang menentukan durasi dan harga video.

  3. 3

    Hasilkan video

    Node InfiniTalk menampilkan durasi suara yang terukur dan harga pasti. Klik: wajah pun berbicara, dalam 480p untuk media sosial atau 720p untuk hasil yang akan diproyeksikan.

  4. 4

    Sambungkan jika teksnya panjang

    Jika suara lebih dari dua puluh delapan detik, potong teks menjadi dua pengambilan dan gabungkan secara berurutan di node Montage, secara gratis, seperti pada workflow video lainnya.

Variasi dan contoh penggunaan

Canvas yang sama, disetel untuk kebutuhan berbeda: setiap variasi hanya butuh dua atau tiga baris prompt yang diubah.

Pesan ulang tahun

Foto orang yang berulang tahun, teks dua puluh kata yang dibacakan dengan suara hangat: itulah contoh kedua dalam demo. Video ini bisa langsung dikirim melalui pesan, tanpa ada seorang pun yang harus merekam dirinya sendiri.

Presentasi produk tanpa syuting

Potret hasil AI berubah menjadi presenter: teks peluncuran di node Voice-over, foto di node Media, dan video keluar dalam 720p, siap untuk halaman produk atau iklan UGC.

Potret lama yang bercerita

Foto keluarga yang dipindai, teks yang ditulis dalam sudut pandang orang pertama: wajah pun hidup dan berbicara. Proses foto tersebut lebih dulu di node Enhance jika ukurannya kecil atau rusak, lalu lanjutkan ke InfiniTalk.

Maskot yang membuat pengumuman

Karakter gambar dengan mulut yang jelas terlihat pun bisa digunakan: model menganimasikan bibir gambar seperti bibir pada foto. Cocok untuk pengumuman merek di media sosial, dengan suara ceria dari katalog.

Pesan yang sama dalam tiga bahasa

Satu foto, tiga node Voice-over dalam tiga bahasa, tiga node InfiniTalk: orang yang sama berbicara dalam bahasa Inggris, Spanyol, dan Prancis, dengan gerakan bibir yang akurat setiap kalinya. Untuk memulai dari video yang sudah direkam, lihat dubbing.

Foto yang berbicara, lalu bergerak

Ambil video yang telah dihasilkan dan proses melalui membuat foto menari atau masukkan ke node Video sebagai referensi: bicara dahulu, gerakan tubuh setelahnya.

Kesalahan umum

Wajah tampak samping atau tiga perempat yang terlalu sempit

Model membutuhkan tampilan mulut secara utuh. Menghadap ke depan atau sedikit miring tiga perempat, sinkronisasi berjalan mulus; sedangkan tampak samping membuat bibir terdistorsi.

Mulut terbuka atau tersembunyi pada foto

Senyum dengan gigi terlihat, tangan di dagu, mikrofon di depan mulut: semuanya menjadi penghalang. Mulut tertutup, wajah bebas dari halangan, dan hasilnya akan tajam.

Menulis teks di node Video

Prompt pada node InfiniTalk menjelaskan sikap, bukan teks. Apa yang diucapkan orang tersebut berasal dari suara yang dihubungkan: teks harus dimasukkan di node Voice-over.

Suara yang terlalu panjang untuk satu kali proses

Lebih dari dua puluh delapan detik, node akan menolak sebelum menghasilkan apa pun, tanpa dikenai biaya. Potong menjadi dua pengambilan dan sambungkan di node Montage.

Model yang direkomendasikan

Pertanyaan umum

Berapa lama foto bisa berbicara?

Dari dua hingga dua puluh delapan detik per generasi, sekitar tujuh puluh kata dengan kecepatan normal. Video berdurasi persis sesuai suara yang dihubungkan: tidak ada yang perlu diatur.

Bisakah saya menggunakan suara saya sendiri?

Ya. Unggah rekaman ke node Media dan hubungkan ke port voice, atau kloning suara Anda di node Voice-over dan biarkan suara itu membacakan teks apa pun.

Apakah harus foto saya sendiri, atau karakter hasil AI juga bisa?

Keduanya bisa. Potret yang dihasilkan oleh node Image, maskot yang digambar, atau foto lama sama-sama bisa berbicara seperti selfie, selama wajah menghadap ke depan dan mulut terlihat jelas.

Apakah saya tetap dikenai biaya jika generasi gagal?

Tidak. Harga dicadangkan saat peluncuran dan dikembalikan secara otomatis jika terjadi kegagalan teknis. Jumlah pasti ditampilkan pada tombol sebelum Anda mengklik.

Apa bedanya dengan avatar berbicara?

Avatar berbicara menghasilkan presenter rekaan lengkap dengan suaranya, sekali jalan, menggunakan Veo. Di sini, foto ANDA yang berbicara, dengan suara pilihan Anda, dan teksnya bisa diubah tanpa perlu menghasilkan ulang karakternya.

Bisakah saya memilih bahasanya?

Ya, di node Voice-over: suara-suara ElevenLabs dapat membacakan empat belas bahasa. Sinkronisasi bibir mengikuti suara yang diucapkan, apa pun bahasanya.

Apakah videonya berformat 16:9 atau vertikal?

InfiniTalk menghasilkan bingkai yang mendekati ukuran foto asli, dalam 480p atau 720p. Untuk format yang lebih tepat, potong ulang bingkainya di node Montage, yang mendukung 9:16, 1:1, dan 16:9.

Bisakah saya membuat beberapa orang berbicara?

Satu orang per node. Untuk dialog, buat dua foto masing-masing berbicara dengan suaranya sendiri, lalu selingi pengambilan gambarnya di node Montage.

Membuat Foto Berbicara dengan AI

Gunakan workflow ini

Akun gratis, tanpa kartu kredit. Workflow terbuka sudah terisi di canvas Anda.