ลองเล่น OmniVoice อีกรอบ จับเวลาการพากย์ แล้วก็เจอบั๊กแปลกๆ
คราวนี้ลองพากย์คลิปอังกฤษเป็นเกาหลี จับเวลาทีละขั้นว่าพากย์รอบนึงใช้เวลาเท่าไหร่ แถมยังเจอเสียงหุ่นยนต์โผล่มาตรงที่ควรจะเป็นเสียงคนอีก
ต่อจากคราวที่แล้ว ผมเล่นกับ OmniVoice ต่ออีกหน่อย คราวนี้สงสัยอยู่สองเรื่อง เรื่องแรกคือพากย์คลิปนึงจริงๆ แล้วใช้เวลานานแค่ไหน อีกเรื่องคือลองสลับทางจากคราวก่อน คือเอาคลิปภาษาอังกฤษมาทำเป็นเกาหลีดูบ้างว่าจะเป็นยังไง
ผมเลยหยิบคลิปพูดสั้นๆ ของ Trump มา (เป็นอังกฤษ) แล้วพากย์เป็นเกาหลี ดูต้นฉบับก่อนเลย:
ต้นฉบับ: คลิปภาษาอังกฤษที่ผมอยากพากย์เป็นภาษาเกาหลี
แล้วนี่คือที่ OmniVoice พากย์เป็นเกาหลีออกมา มันโคลนเสียงต้นฉบับแล้วให้มาพูดเกาหลีให้:
OmniVoice: พากย์อังกฤษ → เกาหลี พร้อมโคลนเสียงต้นฉบับ
การพากย์หนึ่งครั้งใช้เวลานานแค่ไหน
เอาคลิป 22 วินาทีหนึ่งคลิป ไล่ครบทุกขั้น ตั้งแต่ถอดเสียงเป็นข้อความ แปล ปั้นเสียง ไปจนถึงส่งออก รวมแล้ว ประมาณ 3 นาที ทุกอย่างรันบน MacBook ของผม ไม่ต้องต่อเน็ตเลย ถ้าแยกดูทีละขั้นก็จะประมาณนี้:
- เตรียมข้อมูล (ดึงเสียงออกจากวิดีโอ และแยกเสียงคนออกจากเสียงพื้นหลัง): ประมาณ 7 วินาที
- ถอดเสียงเป็นข้อความ (เปลี่ยนคำพูดให้เป็นตัวหนังสือ): ประมาณ 29 วินาที
- แปล (อังกฤษเป็นเกาหลี): ประมาณ 90 วินาที
- สร้างโปรไฟล์เสียง (เก็บเสียงต้นฉบับเอาไว้): ประมาณ 5 วินาที
- ปั้นเสียง + โคลนเสียง: ประมาณ 49 วินาที
- ส่งออก (รวมกลับเข้าไปในวิดีโอ): ประมาณ 2 วินาที
มีจุดน่าสนใจอยู่อย่างนึง รอบแรกที่ปั้นเสียงจะช้าหน่อย แต่พอรันอีกรอบเวลาเหลือแค่ประมาณครึ่งเดียว เพราะรอบแรกมันต้องเสียเวลาโหลดโมเดล AI เข้าหน่วยความจำ ซึ่งโดนนับแค่รอบแรกเท่านั้น
แต่ละขั้นตอนใช้โมเดลอะไร
การพากย์มันแบ่งเป็นขั้นๆ แล้วแต่ละขั้นก็มีโมเดลคนละตัวมาคอยจัดการ:
- แยกเสียงคนออกจากเสียงพื้นหลัง: Demucs
- ถอดเสียงเป็นข้อความ: WhisperX
- กำหนดจังหวะของแต่ละคำ: wav2vec2
- แยกผู้พูด (แยกว่าใครเป็นคนพูด): WavLM
- แปล: gemma2:27b (คุณภาพดีกว่าตัวแปลที่ติดมากับเครื่องมือ)
- ปั้นเสียง + โคลนเสียง: OmniVoice
ไม่ได้ราบรื่นไปทั้งหมด
มีอยู่สองเรื่องที่ทำผมสะดุดระหว่างทาง
หนึ่ง บางทีตรงที่ควรจะเป็นเสียงคน ดันได้ยินเป็นเสียงแตกๆ ซ่าๆ แทน คราวนี้ผมให้มันเอาตัวอย่างเสียงภาษาอังกฤษไปพูดเกาหลี ซึ่งเป็นภาษาที่เจ้าของเสียงไม่เคยพูดมาก่อน บางทีมันก็เลยพัง ผมเลยสลับไปใช้ค่าที่รันหลายรอบขึ้นเพื่อเกลาเสียงให้เนียนขึ้น แล้วรันใหม่ คราวนี้คลิป Trump ก็ออกมาดี
สอง ตอนรันแปล มีอยู่ประโยคนึงที่ออกมาคนละเรื่องกับต้นฉบับเลย ผมเลยต้องเข้าไปแก้เอง
สรุปแล้ว
เทียบกับตัวพากย์เสียงโอเพนซอร์สที่เคยลองมา ตัวนี้ลงง่ายสุดแทบจะคลิกเดียว แถมรันลื่นกว่าตัวอื่นๆ ทุกตัวที่เคยลองด้วย ตรงนี้ผมชอบมากเลย แต่ถึงอย่างนั้น คุณภาพที่ออกมาก็ยังไม่ถึงระดับที่ผมพอใจอยู่ดี
มีใครเคยลอง OmniVoice บ้างไหม อยากรู้ว่าลองกับคลิปแบบไหน แล้วผลออกมาเป็นยังไง ผมรันบน Mac เลยอยากฟังจากคนที่ใช้บนเครื่องอื่นๆ ด้วยเหมือนกัน
จุดที่ชอบ
- ลงง่ายแทบจะคลิกเดียว (ง่ายที่สุดในบรรดาตัวโอเพนซอร์สที่เคยลองมา)
- รันลื่นกว่าตัวโอเพนซอร์สทุกตัวที่เคยลองมาจนถึงตอนนี้
- รันเร็ว (ประมาณ 3 นาทีสำหรับคลิป 22 วินาที)
จุดที่ยังไม่โดนใจ
- ผลลัพธ์ยังไม่ค่อยโดนใจเท่าไหร่
- พอให้เสียงข้ามไปพูดอีกภาษา บางทีก็เพี้ยนเป็นเสียงหุ่นยนต์
คะแนน
รับสรุปข่าวพากย์เสียงด้วย AI รายสัปดาห์
สรุปข่าวและเรื่องราวการพากย์เสียงด้วย AI สัปดาห์ละครั้ง ในภาษาที่คุณเลือก ไม่มีสแปม ยกเลิกได้ทุกเมื่อ
ความคิดเห็น (0)
ยังไม่มีความคิดเห็นเลย มาเป็นคนแรกกันไหมครับ