opendub.ai
#ai-dubbing#omnivoice#open-source#voice-cloning

OmniVoice をまた動かしてみた。吹き替えって、どれくらい時間かかるの?

今回は英語の動画を韓国語に吹き替え。一本やるのにどれくらいかかるか時間を計ってみて、ついでに声が出るはずの場所からロボットみたいなノイズが出たりもしました。

opendub · 2026-06-23 · 4分で読めます

前回の続きで、OmniVoice をもう少し触ってみました。今回気になってたのは二つ。一つは、動画を一本吹き替えるのに実際どれくらい時間がかかるのか。もう一つは、前回とは逆で、英語の動画を韓国語にしたらどうなるのかな、っていうことです。

そこで、Trump の演説の短いクリップ(英語)を持ってきて、韓国語に吹き替えてみました。まずはオリジナルです:

オリジナル:韓国語に吹き替えたかった英語のクリップ

そして、OmniVoice が韓国語に吹き替えた結果がこちらです。元の声をクローンして、韓国語を話させています:

OmniVoice:英語→韓国語に吹き替え、元の声をクローン

一本の吹き替えにどれくらいかかるのか

22秒のクリップ一本を、文字起こしから翻訳、音声合成、書き出しまで通しでやって、合計でだいたい3分でした。ぜんぶ私の MacBook 上で、しかもネットなしで動いてくれましたよ。ステップごとに分けると、こんな感じです:

  • 下準備(動画から音声を抜き出して、声と背景音に分ける):約7秒
  • 文字起こし(話し声を文字にする):約29秒
  • 翻訳(英語から韓国語):約90秒
  • 音声プロファイルの作成(元の声を登録する):約5秒
  • 音声合成+クローン:約49秒
  • 書き出し(動画に戻して合成する):約2秒

おもしろいことに、最初の合成は時間がかかるんですけど、もう一度走らせると、その時間がだいたい半分になるんです。AI モデルをメモリに読み込む時間が、最初の一回だけかかるからですね。

各ステップでどのモデルが動いたか

吹き替えはステップに分かれていて、それぞれを別のモデルが担当します:

  • 声と背景音を分ける:Demucs
  • 文字起こし:WhisperX
  • 単語のタイミング:wav2vec2
  • 話者の分離(誰が話しているかを見分ける):WavLM
  • 翻訳:gemma2:27b(内蔵の翻訳より品質が良い)
  • 音声合成+クローン:OmniVoice

すべてが順調だったわけではありません

途中で二つ、つまずいたことがあります。

一つ目は、声が出るはずの場所から、人の声じゃなくて、つぶれてザラついたノイズが出ることがあったんです。今回は英語の声サンプルから韓国語を作らせたんですが、その声が、一度も話したことのない韓国語をまねしようとして、ときどき崩れちゃったみたいで。そこで、合成をもっと多めの回数かけて仕上げる設定に切り替えて走らせ直したら、Trump の動画はきれいに仕上がりました。

二つ目は、翻訳を走らせたら、ある一文が元とまったく違う内容で出てきちゃって、手で直すことになりました。

まとめると

これまで触ってきたオープンソースの吹き替えツールの中だと、これはほぼワンクリックって言えるくらい簡単に入りました。しかも、今まで試したどれよりもサクサク動いてくれて、そこは正直うれしかったです。とはいえ、出来上がりはまだ、自分が満足できるレベルとまではいかないかな、というのが本音です。

ほかにも OmniVoice を使った方はいますか。どんな動画を試して、品質がどうだったか、ぜひ聞いてみたいです。私は Mac で動かしたので、ほかの環境で使った方の話も気になっています。

良かったところ

  • ほぼワンクリックと言えるくらい簡単にインストールできる(これまで試したオープンソースのツールの中で一番ラク)
  • これまで試したどのオープンソースのツールよりもスムーズに動いた
  • 処理が速い(22秒のクリップで約3分)

いまいちだったところ

  • 出来上がりはまだイマイチ、満足とまではいかない
  • 別の言語で声をまねさせると、たまにロボットみたいな音に崩れる

評価

インストールがラクでサクサク動く · でも仕上がりはまだ物足りない
コメント

コメント (0)

まだコメントはありません。最初のひとことをどうぞ。