REC Zulfikar Idris

Cara Membuat Adegan Dialog yang Mulutnya Sinkron

๐Ÿ’ฌ 0 komentar

Terakhir dicek: 19 September 2026. Butuh build aplikasi 18 September 2026 atau lebih baru.

Panduan ini membuat adegan dua tokoh yang saling bicara dengan mulut bergerak sesuai suaranya: suara kloning Idris keluar, mulut Idris yang bergerak, dan Reyhana diam mendengarkan — lalu sebaliknya. Semuanya jalan di komputer sendiri, tanpa layanan berbayar.

Resepnya melewati tiga fitur, dan urutannya penting:

LangkahDi manaHasilnya
1. Keyframe bermulut tertutupAI Manager → Qwen EditGambar awal: dua tokoh, menghadap kamera, bibir tertutup
2. Video 5 detikTimeline → panel Wan I2VTokoh bernapas dan berkedip, tapi tidak bicara
3. Suara + sinkron mulutAI Manager → Foto to Video → Serial DramaMulut tiap tokoh bergerak hanya di gilirannya

Kenapa resepnya begini: urutan ini hasil lima video uji dengan dialog yang sama, dan tiap percobaan diukur — ketajaman mulut, bukaan mulut tiap tokoh per frame, dan kemiripan wajah dari detik ke detik. Setiap aturan di bawah lahir dari satu kegagalan yang terukur: mulut orang yang salah ikut bergerak, senyum yang terbawa dari video, mulut pendengar ikut "bicara", dan wajah yang berubah saat kepala menoleh.

Sebelum mulai

  • ComfyUI menyala di port 8188, dan server suara (Qwen3-TTS atau CosyVoice) juga menyala. Lihat panduan P2.
  • LatentSync sudah terpasang di H:\LatentSync. Ia punya lingkungan Python sendiri, terpisah dari ComfyUI, karena versi pustakanya bentrok. Foldernya tidak boleh berspasi. Lokasinya disimpan di setelan FolderLatentSync dalam %APPDATA%\Idris Back Media\api_settings.json.
  • Foto acuan wajah asli tiap tokoh — foto sungguhan, bukan gambar buatan AI. Gambar AI hanya "mirip" orangnya, dan kemiripan yang turun di sini akan turun lagi di setiap langkah berikutnya.
  • Peta Suara sudah diisi: tiap tokoh dipasangkan ke preset suara kloningnya.

Langkah 1 — Keyframe dengan mulut tertutup

Mulai dari gambar yang sudah berisi kedua tokoh (hasil resep Qwen Edit langkah 3). Kalau salah satu tokoh tersenyum lebar atau mulutnya terbuka, tutup dulu di sini. Alasannya sederhana: sinkron mulut hanya menggambar ulang bagian mulut sampai dagu, jadi senyum lebar di gambar awal ikut terbawa — hasilnya bibir yang bicara di wajah yang tetap tertawa.

  1. Gambar acuan: gambar dua tokoh itu saja. Tanpa foto tokoh tambahan — itu hanya memancing tokoh kembar.
  2. Instruksi ditulis dalam kalimat positif:
    Reyhana's lips are gently closed and relaxed, with a calm, attentive face. Idris keeps his calm face with lips closed. Keep everything else exactly the same: framing, faces, clothing, the bamboo railing, the rice fields and the hills. Just the two of them.
  3. Steps 20, CFG 3, LoRA Lightning mati, ukuran 1568×896.
  4. Swap wajah hidup, wajah sumber berurutan kiri ke kanan: foto asli Idris, lalu foto asli Reyhana.
  5. Patok seed dan coba beberapa angka (3001, 3002, …). Pilih yang mulutnya tertutup dan tepinya bersih.
  6. Tekan Simpan sebagai keyframe.
Perbandingan gambar sebelum dan sesudah: Reyhana tersenyum lebar menjadi bibir tertutup, bingkai dan baju tetap sama
Kiri: gambar awal, Reyhana tertawa lebar. Kanan: seed 3001 — bibir tertutup, posisi dan baju sama persis (bergeser kurang dari 3 piksel).

Jangan pakai kalimat larangan seperti "not smiling". Qwen tidak punya kolom negatif, jadi kata "smiling" justru memanggil senyum. Tulis keadaan yang diinginkan: lips gently closed, calm face.

Periksa tepi gambar tiap seed. Seed 1000 dalam uji ini mengecilkan seluruh gambar 8% lalu mengisi celahnya dengan pita palsu bertekstur bambu di bawah. Pita itu akan ikut jadi bingkai diam di video.

Langkah 2 — Video 5 detik di Timeline

  1. Buka Timeline, tekan Import Media, pilih keyframe dari folder Keyframes.
  2. Klik ganda keyframe itu di daftar media supaya masuk ke track video, lalu klik klipnya sekali untuk memilih.
  3. Di panel kanan, buka tab Wan I2V. Nama klip terpilih tampil di bawah judul Wan AI — Gambar → Video.
  4. Model: Wan 2.2 TI2V 5B (ringan). Rasio: 16:9.
  5. Isi Prompt Gerakan / Cerita dengan prompt v3 di bawah, dan Negative Prompt dengan daftar larangannya.
  6. Tekan ๐Ÿš€ Generate Video. Sekitar 7–8 menit kemudian klip gambar berganti menjadi video 5,04 detik (121 frame, 24 fps). Berkasnya ada di Generated_Videos, namanya diawali wan_.

Prompt gerak v3 (ganti latarnya sesuai keyframe):

Idris and Reyhana sit side by side on the bamboo veranda, both looking straight at the camera.
They stay turned toward the camera the whole time, never turning to the side.
Natural small motion all the way through: slow breathing that lifts the shoulders, occasional
blinking, tiny head nods, small weight shifts. A light breeze moves their hair and the rice
field behind them, and the leaves of the roof sway slightly.
Lips stay gently closed, calm attentive faces.
Static camera, no zoom, no pan. Exactly two people.

Negative Prompt:

talking, speaking, mouth open, lip movement, laughing, smiling widely,
turning head away, looking away, profile view,
frozen image, still photo, no motion,
camera zoom, camera pan, extra person, face morphing, changing face, distorted face
Timeline dengan klip keyframe dan panel Wan I2V di kanan; kotak prompt di gambar ini masih berisi versi lama v1
Tab Wan I2V di kanan Timeline. Klip gambarnya harus dipilih dulu; setelah render, klip itu sendiri yang berganti jadi video. Teks prompt di gambar ini masih versi lama (v1) — salin teks v3 di atas.

Kenapa prompt ini, kata demi kata. Tiga versi diuji dari keyframe yang sama:

VersiKalimat kuncinyaYang terjadi
v1small head turnsKepala menoleh sampai 32° di detik 4–5. Kemiripan wajah Reyhana jatuh dari 0,96 ke 0,55
v2heads steady + negatif head turnWajah terjaga (0,93 sampai detik 5), tapi videonya membeku: gerak wajah tinggal seperlima
v3keep facing the camera + gerak lewat napas, kedip, angguk, anginHidup dan wajah terjaga: kemiripan tidak pernah di bawah 0,88 selama 5 detik, bibir tetap tertutup
Dua baris potongan wajah dari detik 0 sampai 5: baris atas kepala menoleh di akhir, baris bawah tetap menghadap kamera
Atas: v1, kepala mulai menoleh di detik 4 dan wajahnya ikut berubah. Bawah: v3, tetap menghadap kamera sampai detik 5.

Tidak boleh ada kata "bicara" di prompt gerak. Kalau Wan disuruh bicara, ia menggerakkan mulut sendiri — termasuk mulut tokoh yang sedang mendengar. Sinkron mulut hanya menggarap tokoh yang sedang giliran bicara, jadi mulut pendengar yang ikut bergerak tidak akan dibetulkan. Pada salah satu uji dari tab Cepat, mulut Idris terbuka selebar orang bicara selama Reyhana yang bicara.

Satu shot = satu render 5 detik. Jangan menyambung render (tab Cepat 10 detik menyambung dua segmen). Pada video 10 detik yang disambung, kemiripan wajah di detik 8 tinggal 0,42 dan 0,30. Untuk adegan yang lebih panjang, buat beberapa shot 5 detik, masing-masing dari keyframe sendiri, lalu susun di Timeline — sebaiknya dengan sudut kamera berbeda, supaya sambungannya tidak terlihat melompat.

Langkah 3 — Suara dan sinkron mulut

Buka AI Manager → Foto to Video → ๐ŸŽญ Serial Drama (Multi-Karakter).

  1. Susun Naskah seperti biasa. Pastikan tiap tokoh punya foto referensi — foto itulah yang dipakai untuk mengenali wajahnya.
  2. Klik adegan di daftar, lalu tekan ๐ŸŽž Pakai Video... dan pilih video hasil langkah 2. Kolom status adegan berubah jadi ๐ŸŽž Video. Tombol Render akan melewati adegan ini.
  3. Tekan ๐Ÿ”Š Buat Suara + Gabung. Tiap baris dialog disuarakan lewat Peta Suara, disambung jadi satu trek, lalu dipasang ke video.
  4. Tekan ๐Ÿ‘„ Sinkronkan Mulut, lalu Yes di kotak konfirmasi. Kalau tidak ada adegan yang dipilih, semua adegan yang sudah bersuara ikut diproses.
  5. Tunggu sekitar 1–1,5 menit per adegan 5 detik. Hasilnya …_bersuara_sinkron.mp4 di folder Generated_Videos, dan status adegan berubah jadi ๐Ÿ‘„ Sinkron.
Panel Serial Drama dengan tombol Pakai Video, Buat Suara + Gabung, dan Sinkronkan Mulut
Tombol ๐ŸŽž Pakai Video... ada di bawah Pakai Keyframe; ๐Ÿ‘„ Sinkronkan Mulut tepat di bawah Buat Suara + Gabung.
Dua frame hasil: di giliran Idris hanya mulut Idris yang terbuka, di giliran Reyhana hanya mulut Reyhana
Hasil: di giliran Idris hanya mulut Idris yang bergerak dan Reyhana diam; di giliran Reyhana sebaliknya.

Cara kerjanya, singkat. LatentSync hanya bisa menggarap satu wajah per frame, dan kalau ada dua wajah ia berpindah-pindah tanpa aturan — mulut yang salah ikut bergerak dan muncul kedipan tipis. Karena itu tombol ini memotong hanya wajah pembicara untuk tiap baris dialog, menyinkronkannya dengan potongan suara baris itu, lalu menempelkannya kembali. Siapa pembicaranya dikenali dari kemiripan dengan foto referensi tokohnya, dan kapan ia bicara dihitung dari panjang suara tiap baris.

Aturan yang menentukan hasil

AturanAlasannya (terukur)
Wajah pembicara minimal ~105 piksel di video 1280 pikselWajah 65–69 px: mulut tampak tercoreng. Wajah 108–120 px: rapi. Pakai medium shot atau close-up untuk dialog; two-shot yang jauh cocok untuk reaksi tanpa dialog
Wajah menghadap kameraPada adegan yang wajahnya menyamping ~45° sepanjang video, kemiripan Reyhana turun ke 0,55–0,65 mulai detik 3. Wajah menyamping juga paling sulit dibedakan saat memilih pembicara
Dialog di ~3 detik pertamaWajah paling terjaga di awal shot
Mulut tertutup di keyframe, prompt gerak tanpa bicaraSemua gerak mulut harus datang dari sinkron mulut, supaya waktunya pasti cocok dengan suara
Satu shot = satu render 5 detikDi video 10 detik yang disambung, wajah di detik 8 tinggal 0,42 dan 0,30. Shot baru dari keyframe sendiri mulai lagi dari wajah yang mirip

Peringatan sesudah sinkron

Kalau ada yang meragukan, aplikasi menampilkan catatan setelah sinkron selesai:

CatatanArtinya
wajah hanya … px — mulut akan tampak tercorengWajah di bawah 75 px. Buat ulang shot-nya lebih dekat
ukuran ini belum pernah diujiWajah 75–105 px. Belum pernah diukur — periksa mulutnya dengan mata
dua wajah sama-sama (tidak) mirip foto acuannyaAplikasi ragu siapa pembicaranya. Periksa foto referensi tokohnya
Trek dialog dan potongan per barisnya tidak sepadanTekan Buat Suara + Gabung lagi, lalu sinkronkan ulang

Jebakan yang sudah terbukti

  • Buat Suara + Gabung mengulang SEMUA adegan berdialog setiap kali ditekan, dan suaranya selalu sedikit berbeda. Hasil sinkron yang sudah jadi langsung basi — sinkronkan ulang adegan yang sudah bagus.
  • Render di Serial Drama memakai prompt gerak tulisan Gemini, yang bisa berisi tokoh bicara dan menoleh. Dalam uji, adegan yang dirender begitu tetap bisa disinkron, tapi wajah Reyhana turun ke 0,55 dan mulutnya masih bergerak setelah barisnya selesai. Untuk dialog, pakai jalur Timeline + Pakai Video.
  • Data adegan hanya disimpan di memori. Menutup aplikasi menghapus daftar adegan, video yang dipasang, dan suara per baris. Berkas hasil di disk tetap aman.
  • Dua render dari keyframe yang sama jangan disambung langsung. Tiap render mulai dari pose yang sama, jadi di sambungannya gambar melompat balik.
  • Server suara belum menyala muncul sebagai pesan Neither Qwen3-TTS (Gradio 7860-7880) maupun CosyVoice server (6006) aktif. Nyalakan servernya, lalu ulangi.

Kalau gagal

PesanArtinya
LatentSync belum siap: …Folder LatentSync, Python-nya, atau skripnya tidak ditemukan — atau jalurnya berspasi
belum ada suara — tekan Buat Suara + Gabung duluSinkron butuh suara per baris dari sesi yang sama
belum ada video bersuaraPasang video (Render atau Pakai Video), lalu Buat Suara + Gabung
tokoh '…' tidak punya foto acuanTokoh itu belum diberi foto referensi di naskah
Sinkron mulut gagal (exit …)Pesan lengkapnya ada di berkas log yang disebut di pesan, di folder H:\LatentSync\kerja

Ringkasan

Langkah 1 Qwen Edit : acuan = gambar dua tokoh saja, instruksi positif "lips gently closed",
                      20/3, Lightning mati, swap foto ASLI kiri->kanan, patok seed, cek tepi
Langkah 2 Timeline  : Import Media -> klik ganda -> pilih klip -> tab Wan I2V,
                      TI2V 5B, prompt gerak v3 + negatif, satu render 5 detik
Langkah 3 Serial Drama : pilih adegan -> Pakai Video -> Buat Suara + Gabung -> Sinkronkan Mulut
Aturan              : wajah >= 105 px, menghadap kamera, dialog di 3 detik pertama,
                      tanpa kata "bicara" di prompt gerak, satu shot = 5 detik
Hasil               : Generated_Videos\..._bersuara_sinkron.mp4

Komentar