我花两周做了个配音软件,然后发布了
上一篇还是 7 月 14 日,一晃差不多一个月。这段时间我在忙什么呢?我从用配音工具的那一边,跑到了做配音工具的这一边。
开源的配音工具我用过不少。在这个博客写过体验,也找出过 bug、修好了再发回去。用得多了,哪里不顺手也就越来越清楚,某天心里冒出一句:“与其这样,不如自己做一个。”于是我真做了。它叫 PersoDub,是个桌面配音软件,8 月 7 日发布了第一个版本。
声音老是被加速,我一直觉得别扭
做它的理由只有一个。
配音的时候,翻译出来的句子经常比原来的台词长。韩语里 3 秒说完的一句,换成英语可能要 4 秒。这时候大部分工具会把声音加速,硬塞回 3 秒里。偶尔一两句听不出来,可整段视频都这样,听着就不像人在说话,更像在听倍速播放。
PersoDub 干脆不这么干。它不去动声音,而是在翻译那一步就把长度控制好:每句话都翻成能塞进原来那个位置的长度。视频合成的时候,只要有一句的播放速度不是 1.000 倍,就会被写进日志。这不是靠我自己记着的规矩,是代码替我盯着。
两周,除了睡觉全搭进去了
目标只有一个:不求做得多完美,先把能用的第一个版本快点拿出来。
所以这两周,除了睡觉,剩下的时间全砸在它上面。早上一睁眼就开干,一直做到躺下为止。两周下来,东西真做出来了。
最难的一关是测效果
比做出来更难的,是判断“到这个程度就够了”。
光是挑一个生成人声的模型就花了很久。候选模型一个个接上去,跑同样的句子,再把克隆出来的声音和原声放在一起听,听像不像。这活儿得靠耳朵定,一遍肯定完不了。把说话转成文字的模型也一样,同一段视频喂给每一个,看谁错得少。
这个过程一点都不轻松。搞不定就一直耗着,非弄好不可;心里想着“再试一下应该就成了”,一抬头三四个小时已经没了。
我老是跑偏
还有一个难的地方,是先后顺序。
明明该往下一步走了,可一眼瞟到个小 bug,就忍不住先去修。修着修着又冒出另一个。大事小事一起涌进来,决定先做哪件,比动手做还难。回头看,能在两周里发出来,靠的不是做得快,而是早早定下一句话:“这版必须跑通的就这些,别的功能留到下次发布。”先把这一版要上的功能框死。
做出来是这个样子
原视频(英语)
用 PersoDub 配音(韩语)
同一段视频,从英语配成韩语。里面的声音,是直接克隆说话人本人的。
丢进一段视频,它会先把背景音和人声分开,把话转成文字,理出谁在什么时候说了话,再翻译,然后克隆每个人的声音重新盖回去。音乐和音效原样留着,只换说话的部分。按默认设置,这一整套都在我那台 MacBook Air M4 上跑。不用账号,不用 API key,除了第一次下载模型,平时也不联网。
现在还没支持所有系统
目前只能在 Apple Silicon 的 Mac 上跑。与其每个系统都支持得半吊子,不如先在一个系统上跑顺。别的系统以后再补上。
一行命令就能装好
装这类东西一直很折磨人:让你下一个,下完了又让你下另一个。我干脆把这些全塞进一行命令里。
curl -fsSL https://raw.githubusercontent.com/stronghamjji/PersoDub/HEAD/install.sh | bash
代码和安装方法都放在 GitHub 上了。毕竟是第一个版本,有 bug 很正常,碰到了就随手发到 issues 里吧!后面开发的事,我也会继续写在这儿。
订阅每周 AI 配音简报
每周帮你梳理 AI 配音动态和新鲜事,用你选的语言发送。绝不发垃圾邮件,随时可以退订。
评论 (0)
还没有评论,来抢个沙发吧。