opendub.ai
#ai-dubbing#omnivoice#open-source#voice-cloning

Aku jalanin OmniVoice lagi, ngitung waktu dubbing-nya, dan nemu beberapa error aneh

Kali ini aku nge-dubbing video bahasa Inggris ke Korea. Aku ngitung waktu tiap langkahnya, dan malah nemu suara robot di tempat yang harusnya ada suara orang.

opendub · 2026-06-23 · 4 menit baca

Nyambung dari tulisan sebelumnya, aku main-main lagi sebentar sama OmniVoice. Kali ini aku penasaran sama dua hal. Pertama, sebenernya berapa lama sih waktu buat nge-dubbing satu video. Kedua, kebalikan dari yang kemarin. Gimana jadinya kalau aku ubah video bahasa Inggris ke bahasa Korea.

Jadi aku ambil klip pendek pidato Trump (bahasa Inggris) terus aku dubbing ke Korea. Ini yang aslinya dulu:

Asli: klip bahasa Inggris yang mau aku dubbing ke Korea

Dan ini hasilnya setelah OmniVoice nge-dubbing ke bahasa Korea. OmniVoice niru suara aslinya terus bikin suara itu ngomong bahasa Korea:

OmniVoice: di-dubbing dari Inggris → Korea, pakai suara asli yang ditiru

Berapa lama sih nge-dubbing satu video?

Buat ngebawa satu klip 22 detik dari transkripsi, terjemahan, bikin suara, sampai ekspor, totalnya makan waktu sekitar 3 menit. Semuanya jalan di MacBook-ku, tanpa internet. Kalau dirinci per langkah, kira-kira gini:

  • Persiapan (ambil audio dari video dan pisahin suara dari latar): sekitar 7 detik
  • Transkripsi (ubah ucapan jadi teks): sekitar 29 detik
  • Terjemahan (Inggris ke Korea): sekitar 90 detik
  • Bikin profil suara (daftarin suara aslinya): sekitar 5 detik
  • Bikin suara + niru suara: sekitar 49 detik
  • Ekspor (gabungin lagi ke video): sekitar 2 detik

Satu hal yang seru. Bikin suara yang pertama makan waktu lebih lama, tapi kalau dijalanin lagi waktunya kepotong kira-kira setengah. Soalnya model AI-nya cuma perlu dimuat ke memori sekali aja, pas putaran pertama.

Model apa yang dipakai di tiap langkah

Dubbing-nya dipecah jadi beberapa langkah, dan tiap langkah ditangani model yang beda:

  • Pisahin suara dan latar: Demucs
  • Transkripsi: WhisperX
  • Penentuan waktu per kata: wav2vec2
  • Misahin siapa yang ngomong: WavLM
  • Terjemahan: gemma2:27b (hasilnya lebih bagus daripada penerjemah bawaan)
  • Bikin suara + niru suara: OmniVoice

Nggak semuanya mulus

Ada dua hal yang sempat bikin aku tersandung di tengah jalan.

Pertama, kadang di tempat yang harusnya ada suara, yang keluar malah suara berisik yang remuk penuh statik, bukan suara orang. Kali ini aku minta dia bikin bahasa Korea dari sampel suara bahasa Inggris, dan suara itu nyoba niru bahasa Korea, bahasa yang belum pernah dia ucapin, jadi kadang keluarnya rusak. Akhirnya aku ganti ke pengaturan yang nge-haluskan suaranya lewat lebih banyak putaran, aku jalanin ulang, dan video Trump-nya pun keluar bagus.

Kedua, pas aku jalanin terjemahannya, satu kalimat keluar beda banget dari aslinya, jadi aku harus masuk dan benerin sendiri pakai tangan.

Jadi kesimpulannya

Dari semua alat dubbing open-source yang pernah kupakai, yang satu ini masangnya hampir tinggal satu klik. Jalannya juga paling mulus dibanding yang lain, dan itu aku suka banget. Tapi hasilnya masih kurang oke.

Ada yang di sini pernah pakai OmniVoice? Aku pengin banget denger video macam apa yang kamu coba dan gimana hasilnya. Aku jalanin di Mac, jadi aku juga penasaran sama yang makainya di perangkat lain.

Yang aku suka

  • Masangnya hampir tinggal satu klik (paling gampang dari semua alat open-source yang pernah kucoba)
  • Jalannya paling mulus dibanding alat open-source lain yang pernah kucoba
  • Prosesnya cepet (sekitar 3 menit buat klip 22 detik)

Yang kurang sreg

  • Hasilnya masih kurang oke
  • Niru suara dari bahasa lain kadang pecah jadi suara robot

Penilaian

masangnya gampang, jalannya mulus · tapi hasilnya masih kurang oke
komentar

Komentar (0)

Belum ada komentar — jadi yang pertama, yuk.