opendub.ai
#ai-dubbing#omnivoice#open-source#voice-cloning

Volví a probar OmniVoice, cronometré el doblaje y me salieron errores rarísimos

Esta vez doblé un vídeo en inglés al coreano. Cronometré paso a paso un doblaje entero, e incluso me salió ruido robótico donde debería haber una voz.

opendub · 2026-06-23 · 4 min de lectura

Como en el post anterior, seguí trasteando con OmniVoice. Esta vez tenía dos curiosidades. Una, cuánto tarda de verdad en doblar un vídeo. La otra, ir al revés que la última vez: qué pasa si paso un vídeo en inglés al coreano.

Así que cogí un clip corto de un discurso de Trump (en inglés) y lo doblé al coreano. Aquí va primero el original:

Original: el clip en inglés que quería doblar al coreano

Y aquí el resultado después de que OmniVoice lo doblara al coreano. Clonó la voz original y la puso a hablar en coreano:

OmniVoice: doblado de inglés a coreano, con la voz original clonada

Cuánto tarda en doblar

Pasar un clip de 22 segundos por todo el proceso, desde sacar el texto hasta traducirlo, ponerle voz y volver a juntarlo, me llevó unos 3 minutos en total. Todo corrió en mi MacBook, sin internet. Paso a paso queda así:

  • Preparación (sacar el audio del vídeo y separar la voz del fondo): unos 7 segundos
  • Transcripción (convertir el habla en texto): unos 29 segundos
  • Traducción (de inglés a coreano): unos 90 segundos
  • Crear el perfil de voz (registrar la voz original): unos 5 segundos
  • Síntesis de voz + clonación: unos 49 segundos
  • Exportación (volver a unirlo con el vídeo): unos 2 segundos

Un detalle curioso: la primera vez que generas la voz tarda más, pero si lo repites baja más o menos a la mitad. Es que cargar el modelo de IA en memoria solo te lo cobra la primera vez.

Qué modelo hace cada paso

El doblaje se reparte en pasos, y de cada uno se encarga un modelo distinto:

  • Separar la voz del fondo: Demucs
  • Transcripción: WhisperX
  • Ajuste de tiempos por palabra: wav2vec2
  • Separación de hablantes (distinguir quién habla): WavLM
  • Traducción: gemma2:27b (mejor calidad que el traductor integrado)
  • Síntesis de voz + clonación: OmniVoice

No todo fue rodado

Hubo dos cosas que me dieron guerra.

Una: a veces, donde debería haber una voz, me salía un ruido roto y raro en vez de algo humano. Esta vez le pedí que generara coreano a partir de una muestra de voz en inglés, y esa voz, intentando imitar el coreano, un idioma que nunca había hablado, a ratos se rompía. Así que cambié a un ajuste que pule la síntesis con más pasadas, lo volví a lanzar, y el vídeo de Trump salió bien.

Dos: al hacer la traducción, una frase salió completamente distinta de lo que decía el original, así que tuve que entrar y corregirla a mano.

Entonces, ¿qué tal?

De todas las herramientas de doblaje de código abierto que he usado, esta fue casi tan fácil de instalar como darle a un botón. También fue más fluida que cualquiera de las otras, y eso se agradece. Eso sí, la calidad del resultado todavía no me deja contento del todo.

¿Alguien más por aquí ha usado OmniVoice? Me encantaría saber qué vídeos probaste y qué tal salió la calidad. Yo lo usé en un Mac, así que también tengo curiosidad por los que lo hayan probado en otros equipos.

Lo que me gustó

  • Casi tan fácil de instalar como un solo clic (la más fácil de todas las herramientas de código abierto que he probado)
  • Funcionó más suave que cualquier herramienta de código abierto que haya probado hasta ahora
  • Procesamiento rápido (unos 3 minutos para un clip de 22 segundos)

Lo que no

  • La calidad del resultado todavía no me convence
  • Clonar una voz a otro idioma a veces se rompe en ruido robótico

Valoración

fácil de instalar, funcionó suave · pero todavía le falta calidad
comentarios

Comentarios (0)

Aún no hay comentarios: sé el primero.