opendub.ai
#ai-dubbing#omnivoice#open-source#voice-cloning

ลองเล่น OmniVoice อีกรอบ จับเวลาการพากย์ แล้วก็เจอบั๊กแปลกๆ

คราวนี้ลองพากย์คลิปอังกฤษเป็นเกาหลี จับเวลาทีละขั้นว่าพากย์รอบนึงใช้เวลาเท่าไหร่ แถมยังเจอเสียงหุ่นยนต์โผล่มาตรงที่ควรจะเป็นเสียงคนอีก

opendub · 2026-06-23 · อ่าน 4 นาที

ต่อจากคราวที่แล้ว ผมเล่นกับ OmniVoice ต่ออีกหน่อย คราวนี้สงสัยอยู่สองเรื่อง เรื่องแรกคือพากย์คลิปนึงจริงๆ แล้วใช้เวลานานแค่ไหน อีกเรื่องคือลองสลับทางจากคราวก่อน คือเอาคลิปภาษาอังกฤษมาทำเป็นเกาหลีดูบ้างว่าจะเป็นยังไง

ผมเลยหยิบคลิปพูดสั้นๆ ของ Trump มา (เป็นอังกฤษ) แล้วพากย์เป็นเกาหลี ดูต้นฉบับก่อนเลย:

ต้นฉบับ: คลิปภาษาอังกฤษที่ผมอยากพากย์เป็นภาษาเกาหลี

แล้วนี่คือที่ OmniVoice พากย์เป็นเกาหลีออกมา มันโคลนเสียงต้นฉบับแล้วให้มาพูดเกาหลีให้:

OmniVoice: พากย์อังกฤษ → เกาหลี พร้อมโคลนเสียงต้นฉบับ

การพากย์หนึ่งครั้งใช้เวลานานแค่ไหน

เอาคลิป 22 วินาทีหนึ่งคลิป ไล่ครบทุกขั้น ตั้งแต่ถอดเสียงเป็นข้อความ แปล ปั้นเสียง ไปจนถึงส่งออก รวมแล้ว ประมาณ 3 นาที ทุกอย่างรันบน MacBook ของผม ไม่ต้องต่อเน็ตเลย ถ้าแยกดูทีละขั้นก็จะประมาณนี้:

  • เตรียมข้อมูล (ดึงเสียงออกจากวิดีโอ และแยกเสียงคนออกจากเสียงพื้นหลัง): ประมาณ 7 วินาที
  • ถอดเสียงเป็นข้อความ (เปลี่ยนคำพูดให้เป็นตัวหนังสือ): ประมาณ 29 วินาที
  • แปล (อังกฤษเป็นเกาหลี): ประมาณ 90 วินาที
  • สร้างโปรไฟล์เสียง (เก็บเสียงต้นฉบับเอาไว้): ประมาณ 5 วินาที
  • ปั้นเสียง + โคลนเสียง: ประมาณ 49 วินาที
  • ส่งออก (รวมกลับเข้าไปในวิดีโอ): ประมาณ 2 วินาที

มีจุดน่าสนใจอยู่อย่างนึง รอบแรกที่ปั้นเสียงจะช้าหน่อย แต่พอรันอีกรอบเวลาเหลือแค่ประมาณครึ่งเดียว เพราะรอบแรกมันต้องเสียเวลาโหลดโมเดล AI เข้าหน่วยความจำ ซึ่งโดนนับแค่รอบแรกเท่านั้น

แต่ละขั้นตอนใช้โมเดลอะไร

การพากย์มันแบ่งเป็นขั้นๆ แล้วแต่ละขั้นก็มีโมเดลคนละตัวมาคอยจัดการ:

  • แยกเสียงคนออกจากเสียงพื้นหลัง: Demucs
  • ถอดเสียงเป็นข้อความ: WhisperX
  • กำหนดจังหวะของแต่ละคำ: wav2vec2
  • แยกผู้พูด (แยกว่าใครเป็นคนพูด): WavLM
  • แปล: gemma2:27b (คุณภาพดีกว่าตัวแปลที่ติดมากับเครื่องมือ)
  • ปั้นเสียง + โคลนเสียง: OmniVoice

ไม่ได้ราบรื่นไปทั้งหมด

มีอยู่สองเรื่องที่ทำผมสะดุดระหว่างทาง

หนึ่ง บางทีตรงที่ควรจะเป็นเสียงคน ดันได้ยินเป็นเสียงแตกๆ ซ่าๆ แทน คราวนี้ผมให้มันเอาตัวอย่างเสียงภาษาอังกฤษไปพูดเกาหลี ซึ่งเป็นภาษาที่เจ้าของเสียงไม่เคยพูดมาก่อน บางทีมันก็เลยพัง ผมเลยสลับไปใช้ค่าที่รันหลายรอบขึ้นเพื่อเกลาเสียงให้เนียนขึ้น แล้วรันใหม่ คราวนี้คลิป Trump ก็ออกมาดี

สอง ตอนรันแปล มีอยู่ประโยคนึงที่ออกมาคนละเรื่องกับต้นฉบับเลย ผมเลยต้องเข้าไปแก้เอง

สรุปแล้ว

เทียบกับตัวพากย์เสียงโอเพนซอร์สที่เคยลองมา ตัวนี้ลงง่ายสุดแทบจะคลิกเดียว แถมรันลื่นกว่าตัวอื่นๆ ทุกตัวที่เคยลองด้วย ตรงนี้ผมชอบมากเลย แต่ถึงอย่างนั้น คุณภาพที่ออกมาก็ยังไม่ถึงระดับที่ผมพอใจอยู่ดี

มีใครเคยลอง OmniVoice บ้างไหม อยากรู้ว่าลองกับคลิปแบบไหน แล้วผลออกมาเป็นยังไง ผมรันบน Mac เลยอยากฟังจากคนที่ใช้บนเครื่องอื่นๆ ด้วยเหมือนกัน

จุดที่ชอบ

  • ลงง่ายแทบจะคลิกเดียว (ง่ายที่สุดในบรรดาตัวโอเพนซอร์สที่เคยลองมา)
  • รันลื่นกว่าตัวโอเพนซอร์สทุกตัวที่เคยลองมาจนถึงตอนนี้
  • รันเร็ว (ประมาณ 3 นาทีสำหรับคลิป 22 วินาที)

จุดที่ยังไม่โดนใจ

  • ผลลัพธ์ยังไม่ค่อยโดนใจเท่าไหร่
  • พอให้เสียงข้ามไปพูดอีกภาษา บางทีก็เพี้ยนเป็นเสียงหุ่นยนต์

คะแนน

ลงง่าย รันลื่น แต่คุณภาพยังไม่สุด

ความคิดเห็น (0)

ยังไม่มีความคิดเห็นเลย มาเป็นคนแรกกันไหมครับ