Terakhir dicek: 19 September 2026. Butuh build aplikasi 18 September 2026 atau lebih baru.
Panduan ini membuat adegan dua tokoh yang saling bicara dengan mulut bergerak sesuai suaranya: suara kloning Idris keluar, mulut Idris yang bergerak, dan Reyhana diam mendengarkan — lalu sebaliknya. Semuanya jalan di komputer sendiri, tanpa layanan berbayar.
Resepnya melewati tiga fitur, dan urutannya penting:
| Langkah | Di mana | Hasilnya |
|---|---|---|
| 1. Keyframe bermulut tertutup | AI Manager → Qwen Edit | Gambar awal: dua tokoh, menghadap kamera, bibir tertutup |
| 2. Video 5 detik | Timeline → panel Wan I2V | Tokoh bernapas dan berkedip, tapi tidak bicara |
| 3. Suara + sinkron mulut | AI Manager → Foto to Video → Serial Drama | Mulut tiap tokoh bergerak hanya di gilirannya |
Kenapa resepnya begini: urutan ini hasil lima video uji dengan dialog yang sama, dan tiap percobaan diukur — ketajaman mulut, bukaan mulut tiap tokoh per frame, dan kemiripan wajah dari detik ke detik. Setiap aturan di bawah lahir dari satu kegagalan yang terukur: mulut orang yang salah ikut bergerak, senyum yang terbawa dari video, mulut pendengar ikut "bicara", dan wajah yang berubah saat kepala menoleh.
Sebelum mulai
- ComfyUI menyala di port 8188, dan server suara (Qwen3-TTS atau CosyVoice) juga menyala. Lihat panduan P2.
- LatentSync sudah terpasang di
H:\LatentSync. Ia punya lingkungan Python sendiri, terpisah dari ComfyUI, karena versi pustakanya bentrok. Foldernya tidak boleh berspasi. Lokasinya disimpan di setelanFolderLatentSyncdalam%APPDATA%\Idris Back Media\api_settings.json. - Foto acuan wajah asli tiap tokoh — foto sungguhan, bukan gambar buatan AI. Gambar AI hanya "mirip" orangnya, dan kemiripan yang turun di sini akan turun lagi di setiap langkah berikutnya.
- Peta Suara sudah diisi: tiap tokoh dipasangkan ke preset suara kloningnya.
Langkah 1 — Keyframe dengan mulut tertutup
Mulai dari gambar yang sudah berisi kedua tokoh (hasil resep Qwen Edit langkah 3). Kalau salah satu tokoh tersenyum lebar atau mulutnya terbuka, tutup dulu di sini. Alasannya sederhana: sinkron mulut hanya menggambar ulang bagian mulut sampai dagu, jadi senyum lebar di gambar awal ikut terbawa — hasilnya bibir yang bicara di wajah yang tetap tertawa.
- Gambar acuan: gambar dua tokoh itu saja. Tanpa foto tokoh tambahan — itu hanya memancing tokoh kembar.
- Instruksi ditulis dalam kalimat positif:
Reyhana's lips are gently closed and relaxed, with a calm, attentive face. Idris keeps his calm face with lips closed. Keep everything else exactly the same: framing, faces, clothing, the bamboo railing, the rice fields and the hills. Just the two of them. - Steps 20, CFG 3, LoRA Lightning mati, ukuran 1568×896.
- Swap wajah hidup, wajah sumber berurutan kiri ke kanan: foto asli Idris, lalu foto asli Reyhana.
- Patok seed dan coba beberapa angka (3001, 3002, …). Pilih yang mulutnya tertutup dan tepinya bersih.
- Tekan Simpan sebagai keyframe.
Jangan pakai kalimat larangan seperti "not smiling". Qwen tidak punya kolom negatif, jadi kata "smiling" justru memanggil senyum. Tulis keadaan yang diinginkan: lips gently closed, calm face.
Periksa tepi gambar tiap seed. Seed 1000 dalam uji ini mengecilkan seluruh gambar 8% lalu mengisi celahnya dengan pita palsu bertekstur bambu di bawah. Pita itu akan ikut jadi bingkai diam di video.
Langkah 2 — Video 5 detik di Timeline
- Buka Timeline, tekan Import Media, pilih keyframe dari folder
Keyframes. - Klik ganda keyframe itu di daftar media supaya masuk ke track video, lalu klik klipnya sekali untuk memilih.
- Di panel kanan, buka tab Wan I2V. Nama klip terpilih tampil di bawah judul Wan AI — Gambar → Video.
- Model: Wan 2.2 TI2V 5B (ringan). Rasio: 16:9.
- Isi Prompt Gerakan / Cerita dengan prompt v3 di bawah, dan Negative Prompt dengan daftar larangannya.
- Tekan ๐ Generate Video. Sekitar 7–8 menit kemudian klip gambar berganti menjadi video 5,04 detik (121 frame, 24 fps). Berkasnya ada di
Generated_Videos, namanya diawaliwan_.
Prompt gerak v3 (ganti latarnya sesuai keyframe):
Idris and Reyhana sit side by side on the bamboo veranda, both looking straight at the camera.
They stay turned toward the camera the whole time, never turning to the side.
Natural small motion all the way through: slow breathing that lifts the shoulders, occasional
blinking, tiny head nods, small weight shifts. A light breeze moves their hair and the rice
field behind them, and the leaves of the roof sway slightly.
Lips stay gently closed, calm attentive faces.
Static camera, no zoom, no pan. Exactly two people.
Negative Prompt:
talking, speaking, mouth open, lip movement, laughing, smiling widely,
turning head away, looking away, profile view,
frozen image, still photo, no motion,
camera zoom, camera pan, extra person, face morphing, changing face, distorted face
Kenapa prompt ini, kata demi kata. Tiga versi diuji dari keyframe yang sama:
| Versi | Kalimat kuncinya | Yang terjadi |
|---|---|---|
| v1 | small head turns | Kepala menoleh sampai 32° di detik 4–5. Kemiripan wajah Reyhana jatuh dari 0,96 ke 0,55 |
| v2 | heads steady + negatif head turn | Wajah terjaga (0,93 sampai detik 5), tapi videonya membeku: gerak wajah tinggal seperlima |
| v3 | keep facing the camera + gerak lewat napas, kedip, angguk, angin | Hidup dan wajah terjaga: kemiripan tidak pernah di bawah 0,88 selama 5 detik, bibir tetap tertutup |
Tidak boleh ada kata "bicara" di prompt gerak. Kalau Wan disuruh bicara, ia menggerakkan mulut sendiri — termasuk mulut tokoh yang sedang mendengar. Sinkron mulut hanya menggarap tokoh yang sedang giliran bicara, jadi mulut pendengar yang ikut bergerak tidak akan dibetulkan. Pada salah satu uji dari tab Cepat, mulut Idris terbuka selebar orang bicara selama Reyhana yang bicara.
Satu shot = satu render 5 detik. Jangan menyambung render (tab Cepat 10 detik menyambung dua segmen). Pada video 10 detik yang disambung, kemiripan wajah di detik 8 tinggal 0,42 dan 0,30. Untuk adegan yang lebih panjang, buat beberapa shot 5 detik, masing-masing dari keyframe sendiri, lalu susun di Timeline — sebaiknya dengan sudut kamera berbeda, supaya sambungannya tidak terlihat melompat.
Langkah 3 — Suara dan sinkron mulut
Buka AI Manager → Foto to Video → ๐ญ Serial Drama (Multi-Karakter).
- Susun Naskah seperti biasa. Pastikan tiap tokoh punya foto referensi — foto itulah yang dipakai untuk mengenali wajahnya.
- Klik adegan di daftar, lalu tekan ๐ Pakai Video... dan pilih video hasil langkah 2. Kolom status adegan berubah jadi ๐ Video. Tombol Render akan melewati adegan ini.
- Tekan ๐ Buat Suara + Gabung. Tiap baris dialog disuarakan lewat Peta Suara, disambung jadi satu trek, lalu dipasang ke video.
- Tekan ๐ Sinkronkan Mulut, lalu Yes di kotak konfirmasi. Kalau tidak ada adegan yang dipilih, semua adegan yang sudah bersuara ikut diproses.
- Tunggu sekitar 1–1,5 menit per adegan 5 detik. Hasilnya
…_bersuara_sinkron.mp4di folderGenerated_Videos, dan status adegan berubah jadi ๐ Sinkron.
Cara kerjanya, singkat. LatentSync hanya bisa menggarap satu wajah per frame, dan kalau ada dua wajah ia berpindah-pindah tanpa aturan — mulut yang salah ikut bergerak dan muncul kedipan tipis. Karena itu tombol ini memotong hanya wajah pembicara untuk tiap baris dialog, menyinkronkannya dengan potongan suara baris itu, lalu menempelkannya kembali. Siapa pembicaranya dikenali dari kemiripan dengan foto referensi tokohnya, dan kapan ia bicara dihitung dari panjang suara tiap baris.
Aturan yang menentukan hasil
| Aturan | Alasannya (terukur) |
|---|---|
| Wajah pembicara minimal ~105 piksel di video 1280 piksel | Wajah 65–69 px: mulut tampak tercoreng. Wajah 108–120 px: rapi. Pakai medium shot atau close-up untuk dialog; two-shot yang jauh cocok untuk reaksi tanpa dialog |
| Wajah menghadap kamera | Pada adegan yang wajahnya menyamping ~45° sepanjang video, kemiripan Reyhana turun ke 0,55–0,65 mulai detik 3. Wajah menyamping juga paling sulit dibedakan saat memilih pembicara |
| Dialog di ~3 detik pertama | Wajah paling terjaga di awal shot |
| Mulut tertutup di keyframe, prompt gerak tanpa bicara | Semua gerak mulut harus datang dari sinkron mulut, supaya waktunya pasti cocok dengan suara |
| Satu shot = satu render 5 detik | Di video 10 detik yang disambung, wajah di detik 8 tinggal 0,42 dan 0,30. Shot baru dari keyframe sendiri mulai lagi dari wajah yang mirip |
Peringatan sesudah sinkron
Kalau ada yang meragukan, aplikasi menampilkan catatan setelah sinkron selesai:
| Catatan | Artinya |
|---|---|
wajah hanya … px — mulut akan tampak tercoreng | Wajah di bawah 75 px. Buat ulang shot-nya lebih dekat |
ukuran ini belum pernah diuji | Wajah 75–105 px. Belum pernah diukur — periksa mulutnya dengan mata |
dua wajah sama-sama (tidak) mirip foto acuannya | Aplikasi ragu siapa pembicaranya. Periksa foto referensi tokohnya |
Trek dialog dan potongan per barisnya tidak sepadan | Tekan Buat Suara + Gabung lagi, lalu sinkronkan ulang |
Jebakan yang sudah terbukti
- Buat Suara + Gabung mengulang SEMUA adegan berdialog setiap kali ditekan, dan suaranya selalu sedikit berbeda. Hasil sinkron yang sudah jadi langsung basi — sinkronkan ulang adegan yang sudah bagus.
- Render di Serial Drama memakai prompt gerak tulisan Gemini, yang bisa berisi tokoh bicara dan menoleh. Dalam uji, adegan yang dirender begitu tetap bisa disinkron, tapi wajah Reyhana turun ke 0,55 dan mulutnya masih bergerak setelah barisnya selesai. Untuk dialog, pakai jalur Timeline + Pakai Video.
- Data adegan hanya disimpan di memori. Menutup aplikasi menghapus daftar adegan, video yang dipasang, dan suara per baris. Berkas hasil di disk tetap aman.
- Dua render dari keyframe yang sama jangan disambung langsung. Tiap render mulai dari pose yang sama, jadi di sambungannya gambar melompat balik.
- Server suara belum menyala muncul sebagai pesan
Neither Qwen3-TTS (Gradio 7860-7880) maupun CosyVoice server (6006) aktif.Nyalakan servernya, lalu ulangi.
Kalau gagal
| Pesan | Artinya |
|---|---|
LatentSync belum siap: … | Folder LatentSync, Python-nya, atau skripnya tidak ditemukan — atau jalurnya berspasi |
belum ada suara — tekan Buat Suara + Gabung dulu | Sinkron butuh suara per baris dari sesi yang sama |
belum ada video bersuara | Pasang video (Render atau Pakai Video), lalu Buat Suara + Gabung |
tokoh '…' tidak punya foto acuan | Tokoh itu belum diberi foto referensi di naskah |
Sinkron mulut gagal (exit …) | Pesan lengkapnya ada di berkas log yang disebut di pesan, di folder H:\LatentSync\kerja |
Ringkasan
Langkah 1 Qwen Edit : acuan = gambar dua tokoh saja, instruksi positif "lips gently closed",
20/3, Lightning mati, swap foto ASLI kiri->kanan, patok seed, cek tepi
Langkah 2 Timeline : Import Media -> klik ganda -> pilih klip -> tab Wan I2V,
TI2V 5B, prompt gerak v3 + negatif, satu render 5 detik
Langkah 3 Serial Drama : pilih adegan -> Pakai Video -> Buat Suara + Gabung -> Sinkronkan Mulut
Aturan : wajah >= 105 px, menghadap kamera, dialog di 3 detik pertama,
tanpa kata "bicara" di prompt gerak, satu shot = 5 detik
Hasil : Generated_Videos\..._bersuara_sinkron.mp4
Komentar
Posting Komentar