オープンソースの AI で、動画をまるっと吹き替えできちゃいました
前は動いたのにまた壊れて…。それでも完成した動画を二本、どうやって作ったか書いてみます。
前にこのツールたちで吹き替えはできてたんです。なのに、まったく同じことをもう一回やろうとしたら、エラーがそっくりそのまま戻ってきました…。でも今回はそれを一個ずつ全部つぶして、両方のツールからちゃんと見られる吹き替えが出てきました。正直、一日のほとんどは詰まってばっかりだったけど、それでもちゃんと動いて、「あと一歩」じゃなくて今度こそ完成した動画をお見せできます。
同じ動画を、二つのやり方で吹き替える
二つのツールは同じ動画を吹き替えました。アルテミス計画の月ミッションについての短い NASA の映像で、パブリックドメイン(著作権フリー)なので、そのまま見比べられます。二つはまったく違うやり方で動きます。
- KrillinAI は、音声を文字起こしし、翻訳して、あらかじめ用意された声で吹き替えます。字幕も一緒に焼き込んでくれます。
- Voice-Pro は、短いサンプルから声をクローンして、その声で吹き替えます。
どちらのツールも手をつける前の、元の動画です:
オリジナル:NASA の映像、英語(吹き替え前)
KrillinAI:何も言わずに失敗してて、これがこわかった
KrillinAI は、吹き替えを始める前からエラーを次々と吐き出しました。大半は、私が入れていた別の吹き替えアプリとぶつかって起きたものです。でも、本当にゾッとしたのはエラーですらなくて、翻訳したはずの結果が、訳されないままただの英語で出てきていたことなんです。警告も出ないし、画面に赤いものも何も出ません。翻訳エンジンがそもそも動いてなくて、KrillinAI はエラーを出す代わりに、元のテキストをまるで翻訳結果みたいにそのまま素通しさせてたんです。私みたいな人間には、これが一番こわいタイプのバグですね。ちゃんと出来てるように見えちゃうから、そもそも確かめようっていう発想すら浮かばないので。
KrillinAI:Edge-TTS の声で吹き替え
ここからは正直な感想をいくつか。無料プランだと Microsoft の声しか使えなくて、しかも声はメニューから選ぶんじゃなくて、コードを打ち込んで選ぶんです。ちょっとしたクセだけど、すぐ慣れます。それでも、オープンソースのツールとしては吹き替えの品質はかなりしっかりしていたし、翻訳も十分通用しました。インターフェースは Voice-Pro よりシンプルで、私はその分こちらが気に入りました。一番ありがたかったのは、きれいで、タイミングもちゃんと合った字幕を勝手に焼き込んでくれて、自分で合わせる必要がなかったことです。無料で使ってみた感触が良かったので、いつか有料の音声クローンも試してみたくなりました。
Voice-Pro:中身を自分で直すはめに
Voice-Pro のエラーは、もっと奥のほう、このツールを組み立てている小さなライブラリの中にありました。そのうちの一つは、吹き替えには使いもしない部品をしつこく要求してきて、起動する前に落ちちゃうんです。一つずつ直してもキリがなくて、一つふさぐと、また同じ仲間の別のエラーが噴き出してきます。最後に効いたのは、それが全部通る一か所でまとめて直すことでした。足りない部品がなくてもいいものなら、落ちる代わりにただ飛ばす、という直し方です。これ一つで、その手のエラーが一気に全部消えました。
比べるならフェアにしたかったので、二つのやり方で動かしました。まずは KrillinAI と同じ Microsoft の声で。なるべく条件をそろえて真っ向勝負させた形です:
Voice-Pro:KrillinAI と同じ Edge-TTS の声
次に、Voice-Pro の本領である、自前の音声クローンで:
Voice-Pro:CosyVoice による音声クローン
クローンは本当に良くて、この二つのツールがやることの中で一番すごい部分だと思います。ただの Microsoft の声よりはっきり時間がかかるんですが、その出来は、余計に待つ甲斐が十分ありました。それと、ここが二つの一番大事な違いなんですけど、Voice-Pro はクローンまで含めて全部タダで使わせてくれるのに、KrillinAI はクローンを有料の API の向こうに置いてるんです。私みたいに最後まで完全無料でいくと決めてる人間には、これがけっこう効いてきます。
並べてみると、二つはずいぶん性格が違いました。KrillinAI の一番の強みは字幕です。勝手にきれいに、ちょうどいいところで区切って出してくれて、こっちで直すことがありません。逆にイマイチなのはテンポで、吹き替えた声を元の尺に合わせようとして速くなったり遅くなったりするので、その伸び縮みがかなり不自然に聞こえちゃいました。きっちり合わせるには、たぶんもうひと手間いると思います。あともう一つ残念だったのが、出来上がった動画から背景の音が抜けちゃってたことですね。
Voice-Pro は逆でした。字幕は自分で直さないといけないけど、それ以外はぜんぶ満足です。声の長さを自動で合わせてくれるのでテンポは一定で自然なままだったし、さっき言ったとおりクローンの声も本当に良かったです。何より背景の音が出来上がった動画にそのまま残ってたので、そのままどこかに投稿できる状態でした。私にとっては、この最後のところが一番大きな違いでしたね。
それぞれにかかった時間
RTX 3080 で、動画全体を一から吹き替えるのにかかった時間です:
| ツールと声 | 時間 |
|---|---|
| KrillinAI (Edge-TTS) | 1分56秒 |
| Voice-Pro (Edge-TTS、同じ声) | 4分4秒 |
| Voice-Pro (CosyVoice クローン) | 4分32秒 |
同じ Edge-TTS の声で比べると、KrillinAI はだいたい二倍速かったです。これは主に、Voice-Pro のほうが背景の音を分けたりする重たい作業を余分にやっているからですね。一番遅いのは CosyVoice で声をクローンするやつで、GPU の上でモデルを一行ずつ動かすからです。とはいえ、どれもものすごく遅いってわけじゃありません。どっちにしても、数分で終わる話です。
その一日が教えてくれたこと
てっきり、大変なのはディスクの空きとかダウンロード待ちだろうと思ってました。全然違った。ファイルは全部ちゃんと落ちてたんです。一番きつかったのは、前は普通に動いてたのに、同じことをやろうとしたらただ動かない、ってこと。これが地味に一番へこむんですよね。まったく新しい問題ならまだ納得できるけど、前回バッチリ動いたものが今回はしれっと動いてくれない。あともう一つ覚えておきたいのは、こっそり失敗するやつに気をつけること。KrillinAI が翻訳してない英語を何も言わずに返してくるの、あれは完全に罠です。だって出力はちゃんと完成して見えちゃうんだもん。
私は相変わらずコードの書けない人間で、ほとんど手探りでやってます。でも今回は、その手探りがちゃんと結果につながりました。同じ動画の完成した吹き替えが二本、まるっと無料のオープンソースツールだけで作れちゃったんです。
評価
週イチのAI吹き替えダイジェストを受け取る
AI吹き替えとニュースを週イチで、選んだ言語でお届けします。スパムは送りませんし、いつでも解除できます。
コメント (0)
まだコメントはありません。最初のひとことをどうぞ。