Cuối cùng mình đã lồng tiếng trọn một video bằng AI mã nguồn mở
Mấy bản lồng tiếng từng chạy ngon lành tự dưng hỏng trên tay mình, mà cuối cùng mình vẫn ra được hai video hoàn chỉnh.
Trước đây mình từng cho mấy công cụ này lồng tiếng được rồi, vậy mà lần này ngồi xuống làm lại đúng y việc cũ, mấy lỗi lại kéo nhau quay về ngay. Lần này mình gỡ từng lỗi một, và cuối cùng cả hai công cụ đều cho ra một bản lồng tiếng thật, xem được hẳn hoi. Gần như cả ngày hôm đó mình ngồi mắc kẹt, thế mà nó vẫn chạy, và rốt cuộc mình có hẳn hai video hoàn chỉnh để khoe, chứ không phải lại một câu chuyện kiểu suýt-thì-xong.
Cùng một đoạn clip, lồng tiếng theo hai cách
Mình cho cả hai công cụ lồng tiếng chung một đoạn clip, một video ngắn miễn bản quyền của NASA về sứ mệnh Mặt Trăng Artemis, để bạn so sánh trực tiếp cho dễ. Hai bên làm theo hai kiểu khác hẳn nhau:
- KrillinAI gỡ lời nói thành chữ, dịch, rồi lồng tiếng bằng một giọng có sẵn, mà còn ghép luôn phụ đề lên video.
- Voice-Pro nhân bản một giọng từ một mẫu ngắn rồi lồng tiếng bằng chính giọng đó.
Đây là bản gốc, trước khi công cụ nào chạm vào nó:
Bản gốc: clip của NASA, tiếng Anh (trước khi lồng tiếng)
KrillinAI: nhìn thì ổn mà thật ra chẳng dịch gì
KrillinAI nhả ra một tràng lỗi trước khi chịu lồng tiếng, phần lớn là do nó cãi nhau với một app lồng tiếng khác mình đã cài. Nhưng cái làm mình chột dạ nhất thì lại chẳng phải lỗi: bản dịch cứ ra nguyên tiếng Anh, chưa dịch gì hết, mà không một dòng cảnh báo, cũng chẳng có gì đỏ lè trên màn hình. Phần dịch đơn giản là không chạy, thế mà thay vì kêu lên một tiếng, KrillinAI lại cho nguyên văn bản gốc đi thẳng qua như thể đó chính là bản dịch. Với người như mình thì đây là kiểu lỗi đáng sợ nhất: nhìn cứ như đã xong rồi, nên mình chẳng đời nào nghĩ tới chuyện kiểm tra lại.
KrillinAI: lồng tiếng bằng một giọng Edge-TTS
Vài lời thật lòng. Ở bản miễn phí, bạn chỉ được dùng mấy giọng của Microsoft, mà chọn giọng thì phải gõ mã của nó vào chứ không bấm từ một danh sách, hơi lạ nhưng quen rất nhanh. Bù lại, lồng tiếng nghe khá chắc tay so với một công cụ miễn phí, bản dịch cũng ổn. Giao diện thì gọn hơn Voice-Pro, và mình lại khoái nó ở chỗ đó. Điều mình ưng nhất: nó tự ghép sẵn phụ đề sạch sẽ, canh giờ chuẩn, nên mình chẳng phải chỉnh tay gì cả. Dùng miễn phí thấy ngon đến mức mình cũng tò mò muốn thử luôn cái tính năng nhân bản giọng trả phí của nó một ngày nào đó.
Voice-Pro: phải tự tay sửa lỗi
Lỗi của Voice-Pro thì nằm sâu hơn, tận trong mấy thư viện nhỏ mà nó dựng lên. Một trong số đó cứ khăng khăng đòi một thứ mà lồng tiếng còn chẳng cần đến, thế là nó sập trước cả khi kịp chạy. Sửa từng cái một thì không bao giờ hết: mình vừa chặn được một cái, lại có cái khác y hệt mọc lên. Cái cuối cùng ăn thua là sửa ngay tại một chỗ duy nhất mà tất cả tụi nó đều đi qua: thiếu thứ tùy chọn nào thì cứ bỏ qua, đừng để nó sập. Sửa mỗi chỗ đó thôi, mà cả đám lỗi biến mất cùng lúc.
Mình chạy nó hai kiểu cho cuộc so sánh được công bằng. Đầu tiên là với cùng giọng Microsoft mà KrillinAI dùng, cố để điều kiện giống nhau hết mức:
Voice-Pro: cùng giọng Edge-TTS như KrillinAI
Rồi đến phần thật sự là sở trường của Voice-Pro, nhân bản giọng của riêng nó:
Voice-Pro: nhân bản giọng bằng CosyVoice
Phần nhân bản giọng thật sự ngon, là thứ ấn tượng nhất mà một trong hai công cụ làm được. Nó chạy lâu hơn giọng Microsoft thường thấy rõ, nhưng kết quả thì xứng đáng với khoảng chờ thêm đó. Và đây là khác biệt mấu chốt giữa hai bên: Voice-Pro cho bạn mọi thứ miễn phí, kể cả nhân bản, còn KrillinAI thì giấu phần nhân bản sau một API trả tiền. Với một người cố giữ mọi thứ hoàn toàn miễn phí như mình, chuyện đó ăn điểm to.
Đặt cạnh nhau, hai công cụ tính cách khác hẳn. Cái tiện nhất của KrillinAI là phụ đề: tự ra sạch sẽ, ngắt câu gọn gàng, chẳng phải sửa gì. Điểm yếu là nhịp đọc: để giọng lồng khớp với bản gốc, nó cứ tăng tốc rồi chậm lại, và cái kiểu co kéo liên tục đó nghe hơi thiếu tự nhiên. Muốn canh giờ ngồi đúng chỗ thì chắc phải tốn thêm chút công. Điều nữa mình thấy tiếc là video hoàn chỉnh ra lò mà phần âm thanh nền bị mất.
Voice-Pro thì đi hướng ngược lại. Phụ đề đúng là bạn phải tự sửa, nhưng mọi thứ còn lại đều làm mình ưng. Độ dài giọng tự khớp luôn, nên nhịp đọc giữ được đều và tự nhiên, và như mình nói rồi, giọng nhân bản nghe rất ổn. Hơn nữa, âm thanh nền được giữ nguyên trong video hoàn chỉnh, nên xong là đăng được luôn chẳng phải đụng tay sửa. Với mình, chính cái đó tạo ra khác biệt lớn nhất.
Mỗi công cụ tốn bao lâu
Trên một chiếc RTX 3080, lồng tiếng trọn đoạn clip từ đầu:
| Công cụ & giọng | Thời gian |
|---|---|
| KrillinAI (Edge-TTS) | 1 phút 56 giây |
| Voice-Pro (Edge-TTS, cùng giọng) | 4 phút 4 giây |
| Voice-Pro (nhân bản CosyVoice) | 4 phút 32 giây |
Với cùng một giọng Edge-TTS, KrillinAI nhanh hơn cỡ gấp đôi, chủ yếu vì Voice-Pro làm thêm mấy việc nặng hơn, như tách riêng phần âm thanh nền ra. Nhân bản giọng bằng CosyVoice là chậm nhất, vì nó chạy một mô hình trên GPU từng dòng một. Mà nói thật, chẳng cái nào chậm cả. Đằng nào cũng chỉ vài phút thôi.
Hôm đó mình học được gì
Mình cứ tưởng phần khó sẽ là dung lượng ổ đĩa hay ngồi chờ tải về. Hóa ra không phải. Mọi thứ tải xong xuôi hết. Phần khó nhất là mấy thứ này trước đây đều chạy ngon, vậy mà lần này ngồi xuống làm lại đúng y việc cũ, nó cứ thế không chịu chạy. Đó mới là cái làm mình muốn xỉu: không phải lỗi gì mới, mà là thứ lần trước chạy ngon ơ nay tự dưng giở chứng. Bài học mình muốn giữ: hãy coi chừng mấy cái hỏng lặng lẽ. Việc KrillinAI trả về tiếng Anh chưa dịch mà chẳng hé một lời chính là cái bẫy hoàn hảo, vì nhìn cứ như đã xong.
Ở gần như mọi chuyện này, mình vẫn là một đứa mù code mò mẫm trong bóng tối. Nhưng lần này, sự mò mẫm dừng lại ở một nơi có thật: hai bản lồng tiếng hoàn chỉnh của cùng một đoạn clip, làm hoàn toàn bằng mấy công cụ mã nguồn mở miễn phí.
Đánh giá
Nhận bản tin lồng tiếng AI hằng tuần
Bản tổng hợp hằng tuần về lồng tiếng AI và tin tức, bằng ngôn ngữ bạn chọn. Không spam, hủy đăng ký bất cứ lúc nào.
Bình luận (0)
Chưa có bình luận nào, bạn là người đầu tiên nhé.