¿Qué modelos generan sonido junto con el video?

Seedance 2.0 y 2.5, Veo 3.1, Gemini Omni, MiniMax H3, HappyHorse, FLUX 3 Video, Grok Imagine Video y Kling 3 producen la banda sonora en la misma pasada que la imagen (diálogo, efectos, ambiente y música), pero difieren en si el audio viene activado por defecto y en si cuesta más.

Última actualización:

Las familias de audio y video conjuntos

FamiliaAudio por defectoEfecto en el precioCómo pedir el sonido
Seedance 2.0 / 2.5activadoincluidocanales de audio tipados en el prompt
Veo 3.1desactivadostandard ×2, Fast ×1.2, Lite sin audioactiva generate_audio y describe el sonido
Gemini Omni 1.1activado, sin interruptorincluidodescríbelo en prosa
MiniMax H3siempre activadoincluidoetiquetas de diálogo y línea de paisaje sonoro
HappyHorse 1.0 / 1.1activadoincluidonómbralo con palabras o sale casi mudo
FLUX 3 Videoactivado, con interruptorincluidolas líneas habladas exigen un hablante visible
Grok Imagine Videosiempre activadoincluidonombra el sonido; la negación se ignora
Kling 3 (v3.0, O3)activadovaría según el modo, visible en la estimaciónetiquetas de hablante en el diálogo

Todas tienen guía de prompts en su página del modelo; la sintaxis del audio es lo que más varía.

Tres cosas que saber antes de generar

  1. El silencio es un parámetro, no una frase. "Sin música" en el prompt no silencia un modelo: Grok y H3 lo ignoran y otros pueden invocar música. Usa el interruptor donde exista.
  2. El diálogo necesita un hablante visible en FLUX 3 Video, y funciona mejor así en todos: una línea entrecomillada sin nadie en pantalla puede salir como texto en pantalla.
  3. Veo sale mudo si no lo pides. Su interruptor de audio viene desactivado en LUVI porque cambia el precio; la estimación se actualiza al activarlo.

Alternativas con voz propia

Para una voz concreta, genera la locución con un modelo de texto a voz (ElevenLabs, Gemini TTS, MiniMax Speech, Grok Speech) y úsala en un modelo de sincronización labial. La duración del audio fija entonces el precio.

Preguntas frecuentes

¿Puedo desactivar el sonido?

Solo donde el modelo tiene interruptor: Veo y FLUX 3 Video tienen generate_audio. H3, Grok video y Gemini Omni siempre generan audio; en Seedance basta con no incluir el canal de audio en el prompt.

¿Por qué mi clip salió casi en silencio?

La mayoría de estos modelos necesitan que el sonido esté nombrado en el prompt. HappyHorse en particular devuelve casi silencio si no hay ninguna línea de audio escrita; la guía de prompts de la familia muestra la sintaxis.

¿Puedo agregar una pista de voz real en su lugar?

Sí: los modelos de sincronización labial como OmniHuman, VEED y sync toman tu propio archivo de audio y animan la boca a su ritmo.

Más preguntas