ในที่สุดผมก็พากย์เสียงวิดีโอทั้งคลิปได้ด้วย AI โอเพนซอร์ส
ของที่เคยทำได้กลับพังอีกรอบ แต่คราวนี้ผมได้วิดีโอเสร็จๆ ออกมาสองคลิปจริงๆ
ก่อนหน้านี้ผมเคยทำให้เครื่องมือพวกนี้พากย์เสียงได้แล้วนะ แต่พอกลับมานั่งทำสิ่งเดิมเป๊ะๆ อีกครั้ง เออ ปัญหาเดิมก็โผล่มาเลย คราวนี้ผมก็เลยนั่งแก้ทีละอันจนหมด แล้วสุดท้ายเครื่องมือทั้งสองตัวก็พากย์ออกมาเป็นวิดีโอที่ดูได้จริงๆ วันนั้นผมก็ยังนั่งติดอยู่นานเหมือนเดิมแหละ แต่สุดท้ายมันก็เวิร์ก และในที่สุดผมก็มีวิดีโอเสร็จๆ เอาไว้โชว์ ไม่ใช่แค่เล่าว่าเกือบทำได้แล้ว
คลิปเดียวกัน พากย์สองแบบ
เครื่องมือทั้งสองพากย์คลิปเดียวกัน เป็นวิดีโอสั้นสาธารณสมบัติ (ปลอดลิขสิทธิ์) ของ NASA เกี่ยวกับภารกิจดวงจันทร์ Artemis คุณจึงเปรียบเทียบได้ตรงๆ ทั้งสองทำงานคนละแบบกันโดยสิ้นเชิง:
- KrillinAI ถอดเสียงเป็นตัวอักษร แปล แล้วพากย์ด้วยเสียงสำเร็จรูป และยังเผาซับไตเติลลงบนวิดีโอให้ด้วย
- Voice-Pro โคลนเสียงจากตัวอย่างสั้นๆ แล้วพากย์ด้วย เสียงนั้น
นี่คือคลิปต้นฉบับ ก่อนที่เครื่องมือไหนจะแตะมัน:
ต้นฉบับ: คลิปของ NASA ภาษาอังกฤษ (ก่อนพากย์เสียง)
KrillinAI: ดูเหมือนเสร็จแล้ว แต่จริงๆ ไม่ได้แปลเลย
KrillinAI พ่นข้อผิดพลาดออกมารัวๆ ก่อนจะยอมพากย์ ส่วนใหญ่มาจากการไปชนกับอีกแอปพากย์เสียงที่ผมติดตั้งไว้ แต่ตัวที่ทำผมขนลุกจริงๆ กลับไม่ใช่ข้อผิดพลาดด้วยซ้ำ คืองานแปลของผมออกมาเป็นภาษาอังกฤษล้วนๆ ยังไม่ได้แปล โดยไม่มีคำเตือน ไม่มีอะไรขึ้นสีแดงบนจอเลย เครื่องแปลมันแค่ไม่ทำงาน แล้วแทนที่จะบ่นสักคำ KrillinAI ก็ปล่อยข้อความต้นฉบับผ่านไปเฉยๆ เหมือนว่ามันคือคำแปลซะงั้น สำหรับคนอย่างผม นี่แหละบั๊กที่น่ากลัวที่สุด คือผลลัพธ์มันดูเหมือนเสร็จแล้ว เราเลยไม่ทันเอะใจว่าต้องไปตรวจ
KrillinAI: พากย์ด้วยเสียง Edge-TTS
พูดตามตรงนะ ในแบบฟรีคุณจะใช้ได้แค่เสียงของ Microsoft แล้วเวลาเลือกเสียงก็ต้องพิมพ์รหัสของมันเองด้วย ไม่มีเมนูให้กดเลือก ตอนแรกก็งงๆ อยู่ แต่ชินเร็วมาก ส่วนคุณภาพการพากย์ก็ค่อนข้างแน่นสำหรับเครื่องมือโอเพนซอร์ส งานแปลก็ยืนระยะได้ดี หน้าตาการใช้งานก็เรียบง่ายกว่าของ Voice-Pro ซึ่งผมชอบตรงนี้แหละ ที่ผมประทับใจที่สุดคือมันเผาซับไตเติลที่สะอาดและจับจังหวะตรงเป๊ะลงให้เองเลย ผมไม่ต้องไปจัดอะไรเลยสักนิด ใช้แบบฟรีแล้วรู้สึกดีพอจนเริ่มอยากลองฟีเจอร์โคลนเสียงแบบเสียเงินของมันสักวันเหมือนกัน
Voice-Pro: ต้องมานั่งแก้เออเรอร์เอง
ข้อผิดพลาดของ Voice-Pro อยู่ลึกกว่า มันลงไปอยู่ข้างในไลบรารีเล็กๆ ที่เอามาประกอบกันเป็นตัวโปรแกรม ตัวหนึ่งเอาแต่ร้องหาชิ้นส่วนที่ไม่ได้ใช้ในการพากย์ด้วยซ้ำ แล้วก็แครชตั้งแต่ยังไม่ทันได้เริ่ม จะไล่แก้ทีละอันก็ไม่มีวันจบ ปิดอันหนึ่งได้ ก็มีอันคล้ายๆ กันโผล่มาอีก สุดท้ายที่ได้ผลคือไปแก้ที่จุดเดียวที่ทุกตัวต้องวิ่งผ่าน คือบอกให้มันข้ามชิ้นส่วนเสริมที่ขาดไปแทนที่จะแครช เปลี่ยนแค่จุดเดียวเท่านั้น ข้อผิดพลาดที่รุมขึ้นมาทั้งกองก็หายไปพร้อมกันหมด
ผมรันมันสองแบบเพื่อให้การเปรียบเทียบยุติธรรม แบบแรกด้วยเสียง Microsoft ตัวเดียวกัน กับที่ KrillinAI ใช้ ปรับเงื่อนไขให้เหมือนกันมากที่สุดเท่าที่ทำได้:
Voice-Pro: เสียง Edge-TTS ตัวเดียวกับ KrillinAI
จากนั้นด้วยการโคลนเสียงของ Voice-Pro เอง ซึ่งเป็นฟีเจอร์ที่มันถูกสร้างขึ้นมาเพื่อสิ่งนี้จริงๆ:
Voice-Pro: โคลนเสียงด้วย CosyVoice
การโคลนนั้นดีจริงๆ เป็นสิ่งที่เก่งที่สุดที่เครื่องมือทั้งสองทำได้ มันใช้เวลารันนานกว่าเสียง Microsoft ธรรมดาอย่างเห็นได้ชัด แต่ผลลัพธ์ก็คุ้มกับการรอเพิ่มอย่างเต็มที่ และนี่คือความต่างหลักระหว่างสองตัว: Voice-Pro ให้ทุกอย่างฟรี รวมถึงการโคลน ขณะที่ KrillinAI เก็บการโคลนไว้หลัง API แบบเสียเงิน สำหรับคนที่ตั้งใจจะอยู่กับของฟรีล้วนๆ อย่างผม แค่นั้นก็ตัดสินอะไรไปได้เยอะ
พอเอามาวางเทียบกัน สองตัวนี้นิสัยต่างกันมาก ของ KrillinAI ที่สบายจริงๆ คือเรื่องซับไตเติล มันออกมาสะอาดแล้วก็ตัดบรรทัดได้ดีเองโดยที่ผมไม่ต้องไปแก้เลย ส่วนที่ยังไม่ค่อยดีคือเรื่องจังหวะ เพื่อให้เสียงพากย์เข้ากับจังหวะต้นฉบับ มันเร่งบ้างหน่วงบ้าง พอยืดๆ หดๆ อยู่ตลอดสุดท้ายมันก็เลยฟังดูไม่ค่อยเป็นธรรมชาติ ถ้าจะให้จังหวะลงตัวคงต้องลงแรงเพิ่มอีกหน่อย แล้วอีกอย่างที่ผมรู้สึกขาดไปคือวิดีโอที่เสร็จออกมามันโดนถอดเสียงพื้นหลังหายไปด้วย
Voice-Pro ไปอีกทางเลย ซับไตเติลนี่ต้องมานั่งแก้เอง แต่ที่เหลือนอกนั้นผมพอใจหมด ความยาวของเสียงมันจับให้พอดีเองอัตโนมัติ จังหวะเลยนิ่งและเป็นธรรมชาติ แล้วอย่างที่บอก เสียงโคลนก็ฟังดูดีมาก ที่ชอบที่สุดคือเสียงพื้นหลังยังอยู่ครบในวิดีโอที่เสร็จแล้ว เลยเอาไปโพสต์ที่ไหนก็ได้ทันที สำหรับผม ตรงนี้แหละที่ทำให้มันต่างจากอีกตัวมากที่สุด
แต่ละตัวใช้เวลานานแค่ไหน
บน RTX 3080 พากย์ทั้งคลิปตั้งแต่ต้น:
| เครื่องมือ & เสียง | เวลา |
|---|---|
| KrillinAI (Edge-TTS) | 1 นาที 56 วินาที |
| Voice-Pro (Edge-TTS, เสียงเดียวกัน) | 4 นาที 4 วินาที |
| Voice-Pro (โคลน CosyVoice) | 4 นาที 32 วินาที |
ด้วยเสียง Edge-TTS ตัวเดียวกัน KrillinAI เร็วกว่าราวสองเท่า ส่วนใหญ่เพราะ Voice-Pro ทำงานเสริมที่หนักกว่า อย่างการแยกเสียงพื้นหลังออกมา การโคลนเสียงด้วย CosyVoice ช้าที่สุด เพราะมันรันโมเดลบน GPU ทีละบรรทัด ถึงอย่างนั้นก็ไม่มีอันไหนช้าจริงจังหรอก ยังไงก็พูดถึงแค่ไม่กี่นาทีทั้งนั้น
สิ่งที่วันนั้นสอนผม
ผมนึกว่าส่วนที่ยากจะเป็นพื้นที่ดิสก์หรือการนั่งรอดาวน์โหลด ที่ไหนได้ ไม่ใช่เลย ทุกอย่างดาวน์โหลดมาเรียบร้อยดี ส่วนที่ยากที่สุดคือทั้งหมดนี้เคยทำได้มาก่อน แต่พอผมนั่งลงทำสิ่งเดิมเป๊ะๆ อีกครั้ง มันกลับไม่ยอมรันเฉยๆ ตรงนี้แหละที่ทำเอาหัวหมุน มันไม่ใช่ปัญหาใหม่ แต่เป็นของที่ครั้งก่อนทำงานได้ดีๆ คราวนี้กลับนิ่งเงียบไม่ยอมทำงาน อีกอย่างที่อยากจำไว้คือให้ระวังพวกที่พังแบบเงียบๆ การที่ KrillinAI ส่งภาษาอังกฤษที่ยังไม่ได้แปลกลับมาโดยไม่ปริปากสักคำ คือกับดักชั้นดีเลย เพราะผลลัพธ์มันดูเหมือนเสร็จแล้ว
เอาจริงๆ เรื่องพวกนี้เกือบทั้งหมด ผมก็ยังเป็นแค่คนเขียนโค้ดไม่เป็นที่คลำๆ ทางอยู่ในความมืดเหมือนเดิมนั่นแหละ แต่คราวนี้คลำไปคลำมาแล้วมันจบลงที่ของจริงสักที: วิดีโอพากย์เสร็จๆ ของคลิปเดียวกันสองชิ้น ทำขึ้นมาด้วยเครื่องมือโอเพนซอร์สที่ใช้ฟรีล้วนๆ
คะแนน
รับสรุปข่าวพากย์เสียงด้วย AI รายสัปดาห์
สรุปข่าวและเรื่องราวการพากย์เสียงด้วย AI สัปดาห์ละครั้ง ในภาษาที่คุณเลือก ไม่มีสแปม ยกเลิกได้ทุกเมื่อ
ความคิดเห็น (0)
ยังไม่มีความคิดเห็นเลย มาเป็นคนแรกกันไหมครับ