Semua tool

Menyulih Suara Video dengan AI, Bibir Tersinkron

Video seseorang yang berbicara, dengan suara baru dalam bahasa lain: Sync Lipsync 3 menyesuaikan bibir dengan teks baru tersebut. Adegan yang sama dalam bahasa Inggris dan Spanyol, tanpa perlu syuting ulang. Seluruh workflow bisa dilihat tanpa akun.

Demo interaktif

Workflow sungguhan, hasil nyata. Geser dan zoom sesuka Anda.

Gunakan workflow ini

Workflow sebenarnya: video avatar dalam node Media, dua terjemahan yang masing-masing dibacakan oleh node Voice-over, dan dua node Video yang diatur ke Sync Lipsync 3 yang menerima video melalui port video dan suara melalui port voice.

Sekilas info

Apa yang dihasilkan workflow ini
2 video berdurasi 12 detik dalam 720p, format 9:16 · 2 sulih suara
Struktur canvas
8 node terhubung oleh 6 sambungan
Model yang terpasang
ElevenLabs v3, Sync Lipsync 3
Biaya satu kali proses lengkap
sekitar 208 kredit, setara US$2,50

Video yang direkam sekali, lalu dihadirkan dalam berapa pun bahasa yang diperlukan: itulah yang dilakukan sulih suara dengan sinkronisasi bibir. Orang di layar tidak lagi mengucapkan kalimat aslinya, melainkan terjemahannya, dan mulutnya mengikuti suara baru itu bingkai demi bingkai. Wajah, pencahayaan, dan framing tetap seperti saat pengambilan gambar.

Teks yang sudah diterjemahkan dibacakan dalam node Voice-over, dengan suara dari katalog atau suara hasil kloning, milik Anda sendiri misalnya. Node Video yang diatur ke Sync Lipsync 3 menerima video dan suara tersebut, lalu menghasilkan adegan yang sudah disulih suara. Harganya mengikuti durasi hasil akhir, diukur dari kedua berkas Anda, dan langsung terlihat sebelum Anda mengklik.

Demo ini dimulai dari video avatar yang berbicara, dalam bahasa Prancis, kemudian dihasilkan dalam bahasa Inggris lalu Spanyol. Sebuah iklan, video pelatihan internal, presentasi produk: satu kali syuting, satu berkas untuk setiap pasar.

Cara melakukannya

  1. 1

    Unggah video yang ada suara bicaranya

    Wajah tampak dari depan, dengan pencahayaan baik, mulut terlihat jelas, tanpa tangan atau mikrofon di depan wajah. Maksimal dua menit per proses. Video yang direkam dengan ponsel pun bisa digunakan.

  2. 2

    Tulis terjemahan dan pilih suaranya

    Setiap node Voice-over membacakan teks dalam satu bahasa. Pilih suara yang mendekati karakter orang tersebut, atau kloning suaranya sendiri untuk menjaga timbre yang sama dari satu bahasa ke bahasa lainnya.

  3. 3

    Atur cara durasi disesuaikan

    Secara default, hasilnya berhenti pada durasi yang lebih pendek di antara keduanya. Jika suara lebih panjang dari videonya, pilih "loop": video akan berulang mengikuti suara, yang cocok untuk pengambilan gambar menghadap kamera.

  4. 4

    Buat dan bandingkan hasilnya

    Satu node untuk setiap bahasa, semuanya terhubung ke video yang sama. Harga masing-masing mengikuti durasinya. Jalankan ulang hanya untuk bahasa yang belum sesuai.

Variasi dan contoh penggunaan

Canvas yang sama, disetel untuk kebutuhan berbeda: setiap variasi hanya butuh dua atau tiga baris prompt yang diubah.

Iklan dalam lima bahasa

Sebuah iklan yang direkam dalam bahasa Prancis menjadi lima berkas: satu node Voice-over untuk setiap bahasa, satu node Sync Lipsync 3 untuk setiap bahasa, dengan video yang sama sebagai input. Anggarannya terlihat pada setiap tombol sebelum Anda menjalankannya.

Video pelatihan yang diterjemahkan

Seorang pelatih yang direkam menghadap kamera, teksnya diterjemahkan oleh node Teks, dibacakan oleh node Voice-over, dan videonya disulih suara untuk tim di luar negeri. Editingnya tetap sama.

Memperbaiki kalimat tanpa syuting ulang

Sulih suara juga bisa digunakan dalam bahasa yang sama: kalimat yang salah diucapkan, harga yang berubah, nama yang perlu dikoreksi. Tulis ulang teksnya, jalankan lagi, mulutnya akan mengikuti.

Testimoni pelanggan dengan subtitle, lalu disulih suara

Testimoni yang autentik dapat menjangkau audiens asing tanpa kehilangan wajah orang tersebut: sulih suara dengan suara yang mendekati aslinya, dan pertahankan subtitle untuk aksesibilitas.

Avatar hasil AI dalam semua bahasa

Mulai dari video yang dihasilkan oleh avatar yang berbicara atau iklan UGC, lalu sulih suarakan: karakter buatan tersebut dapat berbicara dalam setiap bahasa tanpa perlu membuat ulang adegannya.

Foto sebagai pengganti video

Jika Anda belum memiliki video awal, buat foto berbicara: InfiniTalk menciptakan gerakan wajah dari sebuah potret dan suara.

Kesalahan umum

Video dengan beberapa wajah

Model ini menyinkronkan satu wajah. Dengan dua orang di layar, hasilnya menjadi tidak dapat diprediksi. Buatlah framing hanya pada orang yang berbicara.

Suara yang jauh lebih panjang dari videonya

Dalam mode potong, hasilnya berhenti bersamaan dengan videonya dan bagian akhir teks akan hilang. Persingkat terjemahannya atau gunakan mode loop.

Mulut tertutup selama pengambilan gambar

Tangan, mikrofon, cangkir: apa pun yang melintas di depan mulut akan merusak sinkronisasi pada bingkai tersebut. Pastikan wajah tetap terlihat jelas saat syuting.

Lupa menyertakan musik dan suasana latar

Hasilnya hanya berisi suara. Tambahkan kembali musiknya di node Montage, jika tidak, versi hasil sulih suara akan terdengar lebih hampa dibandingkan aslinya.

Model yang direkomendasikan

Pertanyaan umum

Apakah videonya perlu direkam ulang untuk setiap bahasa?

Tidak: itulah keunggulan utamanya. Satu video saja, satu node Voice-over untuk setiap bahasa, dan bibir akan mengikuti setiap terjemahan.

Apakah suara aslinya tetap dipertahankan?

Tidak, jalur audio hasil akhir adalah suara yang dihubungkan. Untuk mempertahankan musik atau suasana latar, tambahkan kembali di node Montage di atas video yang sudah disulih suara.

Bisakah menyulih suara dengan suara sendiri dalam bahasa lain?

Ya: kloning suara Anda di node Voice-over, tulis terjemahannya, dan suara kloning tersebut akan membacakannya. Bibir akan mengikuti.

Berapa panjang video yang bisa diterima?

Dari satu detik hingga dua menit per proses. Jika lebih panjang, potong videonya di node Montage lalu sulih suara setiap bagian secara terpisah.

Berapa biaya untuk menyulih suara sebuah video?

Harganya mengikuti durasi hasil akhir, per detik, dan langsung terlihat pada tombol begitu video dan suara terhubung. Kegagalan teknis akan dikembalikan biayanya secara otomatis.

Apakah sulih suara berfungsi pada video hasil AI?

Ya, sama baiknya seperti pada video hasil syuting nyata. Adegan dari Wan, Seedance, atau Veo dengan wajah menghadap depan dapat disulih suara seperti video lainnya.

Bisakah gestur dan ekspresi dipertahankan?

Ya: hanya mulut yang dihitung ulang. Tangan, alis, dan gerakan kepala tetap sesuai dengan pengambilan gambar aslinya.

Suara mana yang sebaiknya dipilih agar sulih suara terasa meyakinkan?

Suara dengan register yang sama seperti orangnya, atau kloningannya sendiri. Dengarkan suaranya saja di node Voice-over sebelum menjalankan sinkronisasi.

Menyulih Suara Video dengan AI, Bibir Tersinkron

Gunakan workflow ini

Akun gratis, tanpa kartu kredit. Workflow terbuka sudah terisi di canvas Anda.