Seis formas de hacer hablar una cara en LUVI, y la diferencia que define el precio

LUVI tiene seis familias de lip-sync y hacen dos trabajos distintos: cuatro animan un retrato fijo a partir de un audio y dos vuelven a sincronizar la boca de un video que ya tienes. El trabajo que haces también decide qué reloj pagas: segundos de audio o segundos de video.

Publicado:

A la izquierda, en un estudio oscuro, hay un retrato enmarcado al que entra una onda de sonido ámbar; a la derecha, una tira de fotogramas de la misma cara avanza sobre un riel mientras por debajo se desliza una onda turquesa, y entre ambos descansa un cronómetro.

En el catálogo de LUVI hay seis familias de lip-sync, y el error más común es elegir una para un trabajo que no hace. Cuatro toman un retrato fijo y una pista de audio y animan la cara. Dos toman un video que ya existe y vuelven a sincronizar su boca con un audio nuevo. No se sustituyen entre sí, y el grupo en el que estés también decide contra qué reloj se cuentan tus créditos.

¿Qué trabajo estás haciendo?

Mira qué tienes en la mano. Una fotografía te lleva al primer grupo; un clip de alguien hablando, al segundo.

Un retrato más audio, convertido en video hablado:

  • OmniHuman 1.5: el modelo de ByteDance, con audio de hasta 60 segundos. Sus autores lo describen más allá del movimiento de boca: interpreta el contexto semántico del audio, va más allá del lip-sync simple y permite que los personajes muestren cambios emocionales reales y ajusten sus gestos a lo que dicen y a su intención.
  • VEED Fabric 1.0 y su versión rápida: audio desde un segundo hasta 300, con niveles de resolución.
  • InfiniteTalk: la opción de formato largo, con audio de hasta diez minutos, en 480p o 720p.
  • Kling Avatar, en nivel estándar y pro, pensado para clips de perfil, intros y redes.

Un video existente más audio nuevo, con la boca vuelta a sincronizar:

  • Sync Lipsync v3: el modelo de sync.so, para doblaje y voz en off, con video de hasta 60 segundos.
  • VEED Lipsync: la vía de doblaje de bajo costo, también limitada a 60 segundos de video.

¿Qué reloj estás pagando?

Esta es la parte que sorprende. En el primer grupo el medidor corre sobre el audio; en el segundo, sobre el video. El mismo trabajo en espíritu, dos magnitudes distintas medidas.

A cinco segundos, verificado el 22 de septiembre de 2026, la diferencia es enorme:

  • VEED Lipsync: desde 130 créditos.
  • InfiniteTalk: desde 60 créditos por generación.
  • OmniHuman 1.5: desde 1200 créditos.
  • VEED Fabric 1.0: desde 1650 créditos, y 2200 en la versión rápida.
  • Sync Lipsync v3: desde 2200 créditos.

De ahí salen dos consecuencias prácticas. Primera: doblar un clip existente con VEED Lipsync sale un orden de magnitud más barato que volver a animar un retrato con el mismo guion, así que si ya tienes el material, úsalo. Segunda: en los modelos de retrato, el largo de tu pista de voz es el largo de tu cuenta, así que recortar dos segundos de silencio al inicio de un audio es un ahorro real, y en OmniHuman es exactamente lo que cuenta el medidor.

¿Cuánto puede durar la entrada?

Los techos se diferencian más que los precios, y son límites duros de la ranura, no recomendaciones.

  • 60 segundos: OmniHuman 1.5 (audio), Sync Lipsync v3 (video), VEED Lipsync (video).
  • 300 segundos: VEED Fabric 1.0 y Fabric 1.0 Fast (audio).
  • Diez minutos: InfiniteTalk (audio).

Si tu guion pasa del minuto, esa sola línea reduce seis opciones a tres. Y si pasa de cinco minutos, las reduce a una.

¿Qué les das exactamente?

Todos toman exactamente dos entradas, y las ranuras tienen tipo: la de imagen no acepta un video y la de audio es obligatoria.

  • El grupo de retrato quiere una cara clara y de frente. La misma disciplina que ayuda a convertir una foto en una malla 3D sirve aquí: luz pareja, sin sombra dura cruzando la boca, nada que corte la mandíbula.
  • El grupo de video quiere un busto parlante que ya esté más o menos sincronizada con algo. Volver a sincronizar los labios de una toma donde la persona está de perfil o medio fuera de cuadro es la causa habitual de un resultado que parece pegado.
  • OmniHuman acepta un prompt de texto opcional para afinar; InfiniteTalk también, y suma un seed y una opción de resolución. Los dos modelos que parten de video no aceptan prompt: la instrucción es el audio.

Cómo lo verificamos

  • Modelos: bytedance/avatar-omni-human-v1.5, veed/fabric-1.0/image-to-video y su versión rápida, veed/lipsync, sync/lipsync-v3, el modo InfiniteTalk y los modos de avatar de Kling v2.6.
  • Qué se leyó: las ranuras de referencia, los límites de duración de entrada, los parámetros y el precio de cada modo, tomados tanto del código de catálogo de la aplicación como de las páginas públicas de modelo en vivo.
  • Fecha: 22 de septiembre de 2026.
  • Resultados: las cifras de partida de arriba coincidieron en ambas fuentes para todas las familias. Los techos de duración salen de las definiciones de ranura: 60 segundos en OmniHuman, Sync y VEED Lipsync, 300 en VEED Fabric y diez minutos en InfiniteTalk.
  • Limitaciones: No se generó ninguna salida para este artículo, así que no afirma nada sobre la calidad de la sincronización ni del parecido. Las cifras son pisos: en las familias que cobran por segundo, un audio o un video más largo cuesta más, así que mira la estimación del espacio de trabajo antes de una toma larga.

¿Cuál conviene elegir?

  • Tienes material y lo necesitas en otro idioma. VEED Lipsync primero, por costo; Sync Lipsync v3 cuando la boca tiene que aguantar un primer plano.
  • Tienes una foto y un guion corto. OmniHuman 1.5, por el trabajo de gesto y expresión que describen sus autores, no solo por el movimiento de boca.
  • Tienes una foto y un guion largo. InfiniteTalk, porque es el único que acepta diez minutos de audio en una sola pasada.
  • Necesitas una tanda de clips cortos para redes desde un retrato. Kling Avatar o VEED Fabric, y revisa la estimación para tu duración exacta antes de encolarlos.

En LUVI están en el espacio de trabajo como cualquier otro modelo: lo eliges, llenas las dos ranuras y la estimación en créditos aparece antes de generar. Si primero tienes que armar la pista de voz, los modelos de audio de la misma cuenta pueden hacerla, y toda la cadena se puede montar como flujo de trabajo o manejar desde Claude con el conector de LUVI.

¿Recién llegas? Crea una cuenta de LUVI y prueba con cinco segundos de audio antes de comprometer un guion entero.

Fuentes

  • OmniHuman-1.5. OmniHuman Lab, página del proyecto (en inglés). Consultado el 22 de septiembre de 2026.
  • sync.so. sync.so, sitio del producto (en inglés). Consultado el 22 de septiembre de 2026.
  • VEED. VEED, sitio del producto (en inglés). Consultado el 22 de septiembre de 2026.

Más de Comparativas