又跑了一遍 OmniVoice:给配音掐了表,还碰上几个莫名其妙的 bug
这回把一段英语视频配成了韩语:每一步都掐了表,还遇到本该是人声的地方冒出机器噪音的怪事。
接着上一篇,我又跟 OmniVoice 玩了一阵。这回想搞清楚两件事:一是给一段视频配音,到底要花多久;二是跟上次反过来,把一段英语视频配成韩语会怎么样。
于是我找了一小段 Trump 演讲的片段(英语的),把它配成了韩语。先看原片:
原始:我想配成韩语的那段英语片段
下面是 OmniVoice 把它配成韩语之后的效果。它克隆了原声,让它来说韩语:
OmniVoice:把英语配成韩语,并克隆了原声
配一次音要花多长时间
把一段 22 秒的片段,从转文字、翻译、语音合成到导出,整套走下来一共大约 3 分钟。这些全都在我的 MacBook 上跑,没联网。按步骤拆开来看,大致是这样:
- 准备(把音频从视频里抽出来,再把人声和背景声分开):约 7 秒
- 转文字(把语音变成文字):约 29 秒
- 翻译(英语转韩语):约 90 秒
- 给原声建个档(录入原声):约 5 秒
- 语音合成 + 克隆:约 49 秒
- 导出(重新合回视频里):约 2 秒
还有个有意思的地方:第一次合成会慢一点,再跑一次差不多能快一半。因为 AI 模型头一回得先搬进内存,这点时间全算在第一遍头上了。
每一步分别用的是哪个模型
配音是一步一步来的,每一步背后都是个不同的模型在干活:
- 分离人声和背景声:Demucs
- 转文字:WhisperX
- 单词时间对齐:wav2vec2
- 说话人分离(分清是谁在说话):WavLM
- 翻译:gemma2:27b(质量比自带的翻译器好)
- 语音合成 + 克隆:OmniVoice
也不是一路顺风
中途有两件事把我绊了一下。
一个是,有时候本该出人声的地方,传出来的不是人声,而是一团压扁了、滋滋作响的噪音。这回我拿一段英语声音样本去生成韩语,等于让这个声音去说一门它从没说过的话,有时候就崩了。后来我换了个设定,让它多跑几遍、把声音打磨得更细,重新跑一遍,这段 Trump 视频就出来得好好的了。
另一个是,翻译的时候有一句话出来的意思跟原文差了十万八千里,我只好自己动手改了过来。
那么,结论是
在我用过的开源配音工具里,这个几乎是一键就装好的,跑起来也比我之前试过的都顺,这点我挺喜欢。不过呢,出来的质量还没到让我满意的程度。
这里有人也用过 OmniVoice 吗?挺想听听你拿什么样的视频试过、质量出来怎么样。我是在 Mac 上跑的,所以也很好奇换个环境用起来会是什么感觉。
喜欢的地方
- 几乎一键就能装好(在我试过的开源工具里最省事)
- 跑起来比我到目前为止试过的所有开源工具都顺
- 处理速度快(22 秒的片段大约 3 分钟)
美中不足
- 出来的质量还不太让人满意
- 用一种语言的声音去说另一种语言,有时候会糊成机器人噪音
评分
订阅每周 AI 配音简报
每周帮你梳理 AI 配音动态和新鲜事,用你选的语言发送。绝不发垃圾邮件,随时可以退订。
评论 (0)
还没有评论,来抢个沙发吧。