ผมทำแอปพากย์เสียงเสร็จใน 2 สัปดาห์ แล้วปล่อยออกมาเลยครับ
โพสต์ล่าสุดของผมคือวันที่ 14 กรกฎาคม เท่ากับหายไปเกือบเดือนเลยครับ ช่วงที่หายไปผมทำอะไรอยู่น่ะเหรอ ตอนนั้นผมย้ายจากฝั่งคนที่คอยลองเครื่องมือพากย์เสียง มาเป็นฝั่งคนที่ลงมือทำเองแล้วครับ
เครื่องมือพากย์เสียงโอเพนซอร์สผมลองมาหลายตัวมาก เขียนรีวิวไว้ในบล็อกนี้ก็มี เจอบั๊กแล้วแก้ส่งไปให้เจ้าของโปรเจกต์ก็มี พอลองไปเรื่อยๆ ก็เริ่มเห็นชัดว่าตรงไหนที่ยังไม่ถูกใจ แล้ววันหนึ่งก็คิดขึ้นมาว่า ถ้าอย่างนั้นทำเองเลยดีกว่ามั้ย สุดท้ายก็ทำจริงๆ ครับ ชื่อ PersoDub เป็นแอปพากย์เสียงที่ติดตั้งลงเครื่องคอมพิวเตอร์ แล้วปล่อยเวอร์ชันแรกออกไปเมื่อวันที่ 7 สิงหาคมครับ
เสียงพากย์ที่โดนเร่งให้เร็ว มันขัดใจผมมาตลอด
เหตุผลที่ผมลงมือทำมีข้อเดียวครับ
เวลาพากย์เสียง ประโยคที่แปลออกมามักจะยาวกว่าบทพูดเดิม ภาษาเกาหลีพูด 3 วินาที พอเป็นภาษาอังกฤษอาจกินเวลา 4 วินาที ตรงนี้เครื่องมือส่วนใหญ่จะเร่งเสียงให้เร็วขึ้น เพื่อยัดกลับเข้าไปใน 3 วินาทีเท่าเดิม ครั้งสองครั้งเราไม่ทันสังเกตหรอกครับ แต่พอเป็นแบบนี้ทั้งคลิป มันจะไม่เหมือนคนกำลังพูดแล้ว กลายเป็นเหมือนเรากำลังฟังคลิปแบบเร่งสปีดอยู่
PersoDub เลยไม่ทำแบบนั้นครับ แทนที่จะไปยุ่งกับเสียง มันจัดการความยาวตั้งแต่ตอนแปลเลย คือแปลแต่ละประโยคให้ยาวพอดีกับช่องเวลาเดิมของมัน แล้วตอนประกอบคลิปกลับเข้าด้วยกัน ถ้ามีประโยคไหนเล่นด้วยความเร็วไม่ใช่ 1.000 เท่าเป๊ะๆ มันจะเขียนบันทึกลงล็อกไว้เลย นี่ไม่ใช่กติกาที่ผมต้องคอยจำเองครับ โค้ดมันตรวจให้เอง
2 สัปดาห์ ไม่นับเวลานอน
เป้าหมายของผมมีข้อเดียวครับ ไม่ใช่ทำของที่สมบูรณ์แบบ แต่คือรีบเอาเวอร์ชันแรกที่ใช้งานได้จริงออกมาให้ไวที่สุด
2 สัปดาห์นั้นผมเลยทุ่มเวลาทั้งหมดให้มัน เหลือไว้แค่ตอนนอน ตื่นมาลืมตาปุ๊บก็เริ่มทำ ทำยาวไปจนถึงตอนเข้านอน ผ่านไป 2 สัปดาห์ก็มีของให้ปล่อยออกมาจริงๆ ครับ
ที่หนักที่สุดคือตอนเทสต์คุณภาพ
ที่ยากกว่าการลงมือทำ คือการตัดสินว่า “แค่นี้ก็พอแล้ว” ครับ
แค่เลือกโมเดลที่สร้างเสียงก็กินเวลานานมากแล้วครับ ผมเอาตัวที่คิดว่าน่าจะใช้ได้มาต่อเข้าระบบทีละตัว ให้อ่านประโยคเดียวกัน แล้วเอาเสียงที่โคลนได้มาฟังเทียบกับเสียงต้นฉบับว่าเหมือนกันไหม งานแบบนี้ต้องตัดสินด้วยหู เลยไม่มีทางจบในรอบเดียว โมเดลที่ถอดเสียงพูดเป็นตัวหนังสือก็เหมือนกัน ผมป้อนคลิปเดียวกันให้ทุกตัว แล้วเทียบว่าตัวไหนผิดน้อยกว่ากัน
ไม่มีขั้นตอนไหนจบเร็วเลยสักขั้นครับ อะไรที่ยังไม่ได้ ผมก็ดันต่อจนกว่ามันจะได้ แล้วทุกครั้งที่คิดว่า “อีกนิดเดียวน่าจะเสร็จ” พอเงยหน้าขึ้นมาก็ผ่านไปสามสี่ชั่วโมงแล้ว
ผมออกนอกทางบ่อยมาก
อีกเรื่องที่ยากคือลำดับก่อนหลังครับ
ทั้งที่ควรจะไปทำขั้นต่อไปได้แล้ว แต่พอมีบั๊กเล็กๆ มาสะดุดตา ผมก็ไปนั่งแก้ตัวนั้นก่อน แก้ไปแก้มาก็เจออีกตัว งานใหญ่งานเล็กมันไหลเข้ามาปนกันตลอด การตัดสินใจว่าจะทำอะไรก่อน เลยยากกว่าตัวงานเสียอีก มองย้อนกลับไป ที่จบได้ใน 2 สัปดาห์ไม่ใช่เพราะผมทำเร็วครับ แต่เพราะตกลงกับตัวเองไว้ตั้งแต่แรกว่า “เวอร์ชันนี้อันนี้ต้องใช้งานได้แน่ๆ ส่วนฟีเจอร์เพิ่มเติมค่อยว่ากันรอบหน้า” แล้วเลือกไว้เลยว่ารอบนี้จะปล่อยอะไรออกไปบ้าง
แล้วของที่ออกมาก็เป็นแบบนี้
ต้นฉบับ (ภาษาอังกฤษ)
พากย์ด้วย PersoDub (ภาษาเกาหลี)
คลิปเดียวกัน พากย์จากภาษาอังกฤษเป็นภาษาเกาหลี เสียงที่ได้ยินคือเสียงของคนพูดคนเดิมที่โคลนมาครับ
พอโยนคลิปเข้าไปหนึ่งไฟล์ มันจะแยกเสียงพื้นหลังกับเสียงคนพูดออกจากกัน ถอดคำพูดเป็นตัวหนังสือ แบ่งว่าใครพูดตอนไหน แปลบทพูด แล้วโคลนเสียงของแต่ละคนมาวางทับกลับเข้าไป เสียงเพลงกับเสียงประกอบยังอยู่ครบเหมือนเดิม เปลี่ยนแค่เสียงพูดอย่างเดียว ถ้าใช้ค่าเริ่มต้น ทั้งหมดนี้ทำงานอยู่ใน MacBook Air M4 ของผมเครื่องเดียวครับ ไม่ต้องสมัครบัญชี ไม่ต้องมีคีย์ API และนอกจากตอนโหลดโมเดลครั้งแรกก็ไม่ต้องต่อเน็ตเลย
ตอนนี้ยังไม่รองรับทุกระบบปฏิบัติการ
ตอนนี้ใช้ได้บนแมคที่เป็น Apple Silicon เท่านั้นครับ แทนที่จะรองรับทุกระบบแบบครึ่งๆ กลางๆ ผมอยากให้มันทำงานได้ดีจริงสักระบบก่อน ระบบอื่นไว้ค่อยตามมาทีหลังครับ
ติดตั้งด้วยคำสั่งบรรทัดเดียว
การติดตั้งของพวกนี้มันยากมาตลอดครับ โหลดอันหนึ่งเสร็จ มันก็บอกให้ไปโหลดอีกอัน ผมเลยยัดทุกอย่างไว้ในคำสั่งบรรทัดเดียว
curl -fsSL https://raw.githubusercontent.com/stronghamjji/PersoDub/HEAD/install.sh | bash
โค้ดกับวิธีติดตั้งอยู่บน GitHub ครับ เป็นเวอร์ชันแรกเลยอาจจะมีบั๊กอยู่บ้าง ถ้าเจอก็เขียนไว้ใน issues ได้เลยนะครับ ส่วนเรื่องการพัฒนาต่อจากนี้ ผมจะมาเล่าที่นี่เรื่อยๆ ครับ
รับสรุปข่าวพากย์เสียงด้วย AI รายสัปดาห์
สรุปข่าวและเรื่องราวการพากย์เสียงด้วย AI สัปดาห์ละครั้ง ในภาษาที่คุณเลือก ไม่มีสแปม ยกเลิกได้ทุกเมื่อ
ความคิดเห็น (0)
ยังไม่มีความคิดเห็นเลย มาเป็นคนแรกกันไหมครับ