Dua minggu bikin aplikasi dubbing, dan sudah kurilis
Tulisan terakhirku tanggal 14 Juli, jadi hampir sebulan aku nggak ada kabar. Selama itu ngapain saja? Ternyata aku sudah pindah, dari yang cuma nyobain alat dubbing jadi yang bikin alatnya sendiri.
Alat dubbing open-source sudah lumayan banyak yang kucoba. Ulasannya kutulis di blog ini, dan kalau ketemu bug, kubetulkan lalu kukirim ke pembuatnya. Lama-lama kelihatan sendiri bagian mana yang masih kurang, sampai akhirnya kepikiran, daripada begini mending bikin sendiri saja. Ya sudah, kubikin. Namanya PersoDub, aplikasi dubbing buat komputer, dan versi pertamanya kurilis tanggal 7 Agustus.
Suaranya dipercepat, dan itu bikin risih
Alasan bikinnya cuma satu.
Kalau lagi dubbing, kalimat hasil terjemahannya sering jadi lebih panjang dari dialog aslinya. Kalimat yang di bahasa Korea cuma 3 detik, di bahasa Inggris bisa jadi 4 detik. Nah, kebanyakan alat mengakalinya dengan mempercepat suaranya biar muat lagi di 3 detik. Sekali dua kali sih nggak kerasa. Tapi kalau sepanjang video begitu terus, rasanya bukan kayak orang ngomong, tapi kayak dengerin rekaman yang dipercepat.
PersoDub sengaja nggak melakukan itu. Daripada mengutak-atik suaranya, panjang kalimatnya yang diatur sejak tahap penerjemahan. Tiap kalimat diterjemahkan dengan panjang yang pas buat tempat aslinya, dan waktu videonya disatukan lagi, baris mana pun yang jalannya bukan tepat di kecepatan normal (1x) langsung dicatat di log. Ini bukan aturan yang harus kuingat sendiri. Kodenya yang mengecek.
Dua minggu, kecuali waktu tidur
Targetnya sederhana. Bukan bikin sesuatu yang sempurna, tapi secepatnya mengeluarkan versi pertama yang sudah bisa dipakai.
Jadi selama dua minggu, semua waktuku habis di sini kecuali jam tidur. Bangun tidur langsung mulai, lanjut sampai waktunya tidur lagi. Dua minggu kemudian, ada hasil yang bisa dirilis.
Yang paling berat itu ngetes kualitasnya
Yang lebih berat daripada membuatnya justru menentukan “segini sudah cukup”.
Milih model yang menghasilkan suaranya saja sudah makan waktu lama. Kandidatnya kupasang satu per satu, kucoba dengan kalimat yang sama, lalu suara hasil kloningnya kudengar bolak-balik sama suara aslinya buat menilai mirip atau nggak. Namanya juga menilai pakai telinga, jadi nggak pernah selesai sekali jalan. Model yang mengubah ucapan jadi teks juga begitu. Video yang sama kumasukkan ke tiap model, lalu kubandingkan mana yang salahnya paling sedikit.
Nggak ada bagian yang cepat selesai. Kalau belum jalan, kuoprek terus sampai jalan, dan tiap kali mikir “sedikit lagi juga kelar”, eh tahu-tahu sudah lewat tiga empat jam.
Aku sering banget belok ke urusan lain
Satu lagi yang susah: urutan kerjanya.
Harusnya lanjut ke tahap berikutnya, tapi begitu ada bug kecil kelihatan, aku malah benerin itu duluan. Pas lagi benerin, muncul lagi yang lain. Urusan besar dan kecil datang campur aduk terus, jadi menentukan mana yang dikerjakan duluan itu malah lebih susah daripada mengerjakannya. Kalau kupikir lagi, aku bisa merilis dalam dua minggu itu bukan karena kerjaku cepat. Tapi karena dari awal sudah kutentukan, “di versi ini yang ini wajib jalan, fitur tambahan dipikir di rilis berikutnya”, jadi jelas apa yang keluar duluan.
Jadi, ini hasilnya
Asli (bahasa Inggris)
Hasil dubbing PersoDub (bahasa Korea)
Video yang sama, didubbing dari bahasa Inggris ke bahasa Korea. Suara orang yang bicara di video dikloning apa adanya.
Tinggal masukkan satu video, lalu dia memisahkan suara latar dari suara orang, menuliskan ucapannya jadi teks, memilah siapa bicara dan kapan, menerjemahkan, mengkloning suara tiap orang, lalu menempelkannya kembali ke video. Musik dan efek suara dibiarkan apa adanya, cuma suara orangnya yang diganti. Dengan pengaturan bawaan, semua proses ini jalan di dalam MacBook Air M4 punyaku. Nggak perlu akun, nggak perlu API key, dan selain sekali unduh model di awal, internet juga nggak dipakai.
Belum semua sistem operasi didukung
Untuk sekarang baru jalan di Mac dengan chip Apple Silicon. Daripada mendukung semua sistem tapi setengah-setengah, aku lebih milih dia jalan dengan benar di satu sistem dulu. Sistem lain menyusul nanti.
Pasangnya cukup satu baris perintah
Memasang aplikasi macam ini selalu bikin capek. Disuruh unduh sesuatu, begitu selesai, disuruh unduh yang lain lagi. Semua itu kujadikan satu baris perintah saja.
curl -fsSL https://raw.githubusercontent.com/stronghamjji/PersoDub/HEAD/install.sh | bash
Kode dan cara pasangnya ada di GitHub. Namanya juga versi pertama, jadi mungkin masih ada bug. Kalau ketemu, jangan sungkan, tulis saja di issues! Cerita pengembangannya juga bakal terus kutulis di sini.
Dapatkan rangkuman dubbing AI mingguan
Rangkuman mingguan soal dubbing AI & berita terbaru, dalam bahasa pilihanmu. Tanpa spam, bisa berhenti kapan aja.
Komentar (0)
Belum ada komentar — jadi yang pertama, yuk.