opendub.ai
#ai-dubbing#krillinai#voice-pro#open-source

ในที่สุดผมก็พากย์เสียงวิดีโอทั้งคลิปได้ด้วย AI โอเพนซอร์ส

ของที่เคยทำได้กลับพังอีกรอบ แต่คราวนี้ผมได้วิดีโอเสร็จๆ ออกมาสองคลิปจริงๆ

opendub · 2026-06-05 · อ่าน 4 นาที

ก่อนหน้านี้ผมเคยทำให้เครื่องมือพวกนี้พากย์เสียงได้แล้วนะ แต่พอกลับมานั่งทำสิ่งเดิมเป๊ะๆ อีกครั้ง เออ ปัญหาเดิมก็โผล่มาเลย คราวนี้ผมก็เลยนั่งแก้ทีละอันจนหมด แล้วสุดท้ายเครื่องมือทั้งสองตัวก็พากย์ออกมาเป็นวิดีโอที่ดูได้จริงๆ วันนั้นผมก็ยังนั่งติดอยู่นานเหมือนเดิมแหละ แต่สุดท้ายมันก็เวิร์ก และในที่สุดผมก็มีวิดีโอเสร็จๆ เอาไว้โชว์ ไม่ใช่แค่เล่าว่าเกือบทำได้แล้ว

คลิปเดียวกัน พากย์สองแบบ

เครื่องมือทั้งสองพากย์คลิปเดียวกัน เป็นวิดีโอสั้นสาธารณสมบัติ (ปลอดลิขสิทธิ์) ของ NASA เกี่ยวกับภารกิจดวงจันทร์ Artemis คุณจึงเปรียบเทียบได้ตรงๆ ทั้งสองทำงานคนละแบบกันโดยสิ้นเชิง:

  • KrillinAI ถอดเสียงเป็นตัวอักษร แปล แล้วพากย์ด้วยเสียงสำเร็จรูป และยังเผาซับไตเติลลงบนวิดีโอให้ด้วย
  • Voice-Pro โคลนเสียงจากตัวอย่างสั้นๆ แล้วพากย์ด้วย เสียงนั้น

นี่คือคลิปต้นฉบับ ก่อนที่เครื่องมือไหนจะแตะมัน:

ต้นฉบับ: คลิปของ NASA ภาษาอังกฤษ (ก่อนพากย์เสียง)

KrillinAI: ดูเหมือนเสร็จแล้ว แต่จริงๆ ไม่ได้แปลเลย

KrillinAI พ่นข้อผิดพลาดออกมารัวๆ ก่อนจะยอมพากย์ ส่วนใหญ่มาจากการไปชนกับอีกแอปพากย์เสียงที่ผมติดตั้งไว้ แต่ตัวที่ทำผมขนลุกจริงๆ กลับไม่ใช่ข้อผิดพลาดด้วยซ้ำ คืองานแปลของผมออกมาเป็นภาษาอังกฤษล้วนๆ ยังไม่ได้แปล โดยไม่มีคำเตือน ไม่มีอะไรขึ้นสีแดงบนจอเลย เครื่องแปลมันแค่ไม่ทำงาน แล้วแทนที่จะบ่นสักคำ KrillinAI ก็ปล่อยข้อความต้นฉบับผ่านไปเฉยๆ เหมือนว่ามันคือคำแปลซะงั้น สำหรับคนอย่างผม นี่แหละบั๊กที่น่ากลัวที่สุด คือผลลัพธ์มันดูเหมือนเสร็จแล้ว เราเลยไม่ทันเอะใจว่าต้องไปตรวจ

KrillinAI: พากย์ด้วยเสียง Edge-TTS

พูดตามตรงนะ ในแบบฟรีคุณจะใช้ได้แค่เสียงของ Microsoft แล้วเวลาเลือกเสียงก็ต้องพิมพ์รหัสของมันเองด้วย ไม่มีเมนูให้กดเลือก ตอนแรกก็งงๆ อยู่ แต่ชินเร็วมาก ส่วนคุณภาพการพากย์ก็ค่อนข้างแน่นสำหรับเครื่องมือโอเพนซอร์ส งานแปลก็ยืนระยะได้ดี หน้าตาการใช้งานก็เรียบง่ายกว่าของ Voice-Pro ซึ่งผมชอบตรงนี้แหละ ที่ผมประทับใจที่สุดคือมันเผาซับไตเติลที่สะอาดและจับจังหวะตรงเป๊ะลงให้เองเลย ผมไม่ต้องไปจัดอะไรเลยสักนิด ใช้แบบฟรีแล้วรู้สึกดีพอจนเริ่มอยากลองฟีเจอร์โคลนเสียงแบบเสียเงินของมันสักวันเหมือนกัน

Voice-Pro: ต้องมานั่งแก้เออเรอร์เอง

ข้อผิดพลาดของ Voice-Pro อยู่ลึกกว่า มันลงไปอยู่ข้างในไลบรารีเล็กๆ ที่เอามาประกอบกันเป็นตัวโปรแกรม ตัวหนึ่งเอาแต่ร้องหาชิ้นส่วนที่ไม่ได้ใช้ในการพากย์ด้วยซ้ำ แล้วก็แครชตั้งแต่ยังไม่ทันได้เริ่ม จะไล่แก้ทีละอันก็ไม่มีวันจบ ปิดอันหนึ่งได้ ก็มีอันคล้ายๆ กันโผล่มาอีก สุดท้ายที่ได้ผลคือไปแก้ที่จุดเดียวที่ทุกตัวต้องวิ่งผ่าน คือบอกให้มันข้ามชิ้นส่วนเสริมที่ขาดไปแทนที่จะแครช เปลี่ยนแค่จุดเดียวเท่านั้น ข้อผิดพลาดที่รุมขึ้นมาทั้งกองก็หายไปพร้อมกันหมด

ผมรันมันสองแบบเพื่อให้การเปรียบเทียบยุติธรรม แบบแรกด้วยเสียง Microsoft ตัวเดียวกัน กับที่ KrillinAI ใช้ ปรับเงื่อนไขให้เหมือนกันมากที่สุดเท่าที่ทำได้:

Voice-Pro: เสียง Edge-TTS ตัวเดียวกับ KrillinAI

จากนั้นด้วยการโคลนเสียงของ Voice-Pro เอง ซึ่งเป็นฟีเจอร์ที่มันถูกสร้างขึ้นมาเพื่อสิ่งนี้จริงๆ:

Voice-Pro: โคลนเสียงด้วย CosyVoice

การโคลนนั้นดีจริงๆ เป็นสิ่งที่เก่งที่สุดที่เครื่องมือทั้งสองทำได้ มันใช้เวลารันนานกว่าเสียง Microsoft ธรรมดาอย่างเห็นได้ชัด แต่ผลลัพธ์ก็คุ้มกับการรอเพิ่มอย่างเต็มที่ และนี่คือความต่างหลักระหว่างสองตัว: Voice-Pro ให้ทุกอย่างฟรี รวมถึงการโคลน ขณะที่ KrillinAI เก็บการโคลนไว้หลัง API แบบเสียเงิน สำหรับคนที่ตั้งใจจะอยู่กับของฟรีล้วนๆ อย่างผม แค่นั้นก็ตัดสินอะไรไปได้เยอะ

พอเอามาวางเทียบกัน สองตัวนี้นิสัยต่างกันมาก ของ KrillinAI ที่สบายจริงๆ คือเรื่องซับไตเติล มันออกมาสะอาดแล้วก็ตัดบรรทัดได้ดีเองโดยที่ผมไม่ต้องไปแก้เลย ส่วนที่ยังไม่ค่อยดีคือเรื่องจังหวะ เพื่อให้เสียงพากย์เข้ากับจังหวะต้นฉบับ มันเร่งบ้างหน่วงบ้าง พอยืดๆ หดๆ อยู่ตลอดสุดท้ายมันก็เลยฟังดูไม่ค่อยเป็นธรรมชาติ ถ้าจะให้จังหวะลงตัวคงต้องลงแรงเพิ่มอีกหน่อย แล้วอีกอย่างที่ผมรู้สึกขาดไปคือวิดีโอที่เสร็จออกมามันโดนถอดเสียงพื้นหลังหายไปด้วย

Voice-Pro ไปอีกทางเลย ซับไตเติลนี่ต้องมานั่งแก้เอง แต่ที่เหลือนอกนั้นผมพอใจหมด ความยาวของเสียงมันจับให้พอดีเองอัตโนมัติ จังหวะเลยนิ่งและเป็นธรรมชาติ แล้วอย่างที่บอก เสียงโคลนก็ฟังดูดีมาก ที่ชอบที่สุดคือเสียงพื้นหลังยังอยู่ครบในวิดีโอที่เสร็จแล้ว เลยเอาไปโพสต์ที่ไหนก็ได้ทันที สำหรับผม ตรงนี้แหละที่ทำให้มันต่างจากอีกตัวมากที่สุด

แต่ละตัวใช้เวลานานแค่ไหน

บน RTX 3080 พากย์ทั้งคลิปตั้งแต่ต้น:

เครื่องมือ & เสียง เวลา
KrillinAI (Edge-TTS) 1 นาที 56 วินาที
Voice-Pro (Edge-TTS, เสียงเดียวกัน) 4 นาที 4 วินาที
Voice-Pro (โคลน CosyVoice) 4 นาที 32 วินาที

ด้วยเสียง Edge-TTS ตัวเดียวกัน KrillinAI เร็วกว่าราวสองเท่า ส่วนใหญ่เพราะ Voice-Pro ทำงานเสริมที่หนักกว่า อย่างการแยกเสียงพื้นหลังออกมา การโคลนเสียงด้วย CosyVoice ช้าที่สุด เพราะมันรันโมเดลบน GPU ทีละบรรทัด ถึงอย่างนั้นก็ไม่มีอันไหนช้าจริงจังหรอก ยังไงก็พูดถึงแค่ไม่กี่นาทีทั้งนั้น

สิ่งที่วันนั้นสอนผม

ผมนึกว่าส่วนที่ยากจะเป็นพื้นที่ดิสก์หรือการนั่งรอดาวน์โหลด ที่ไหนได้ ไม่ใช่เลย ทุกอย่างดาวน์โหลดมาเรียบร้อยดี ส่วนที่ยากที่สุดคือทั้งหมดนี้เคยทำได้มาก่อน แต่พอผมนั่งลงทำสิ่งเดิมเป๊ะๆ อีกครั้ง มันกลับไม่ยอมรันเฉยๆ ตรงนี้แหละที่ทำเอาหัวหมุน มันไม่ใช่ปัญหาใหม่ แต่เป็นของที่ครั้งก่อนทำงานได้ดีๆ คราวนี้กลับนิ่งเงียบไม่ยอมทำงาน อีกอย่างที่อยากจำไว้คือให้ระวังพวกที่พังแบบเงียบๆ การที่ KrillinAI ส่งภาษาอังกฤษที่ยังไม่ได้แปลกลับมาโดยไม่ปริปากสักคำ คือกับดักชั้นดีเลย เพราะผลลัพธ์มันดูเหมือนเสร็จแล้ว

เอาจริงๆ เรื่องพวกนี้เกือบทั้งหมด ผมก็ยังเป็นแค่คนเขียนโค้ดไม่เป็นที่คลำๆ ทางอยู่ในความมืดเหมือนเดิมนั่นแหละ แต่คราวนี้คลำไปคลำมาแล้วมันจบลงที่ของจริงสักที: วิดีโอพากย์เสร็จๆ ของคลิปเดียวกันสองชิ้น ทำขึ้นมาด้วยเครื่องมือโอเพนซอร์สที่ใช้ฟรีล้วนๆ

คะแนน

ลงเครื่องก็ยาก บั๊กก็เยอะ · แต่พอชินแล้วใช้ได้เลยนะ

ความคิดเห็น (0)

ยังไม่มีความคิดเห็นเลย มาเป็นคนแรกกันไหมครับ