¿Qué modelos generan sonido junto con el video?
Seedance 2.0 y 2.5, Veo 3.1, Gemini Omni, MiniMax H3, HappyHorse, FLUX 3 Video, Grok Imagine Video y Kling 3 producen la banda sonora en la misma pasada que la imagen (diálogo, efectos, ambiente y música), pero difieren en si el audio viene activado por defecto y en si cuesta más.
Las familias de audio y video conjuntos
| Familia | Audio por defecto | Efecto en el precio | Cómo pedir el sonido |
|---|---|---|---|
| Seedance 2.0 / 2.5 | activado | incluido | canales de audio tipados en el prompt |
| Veo 3.1 | desactivado | standard ×2, Fast ×1.2, Lite sin audio | activa generate_audio y describe el sonido |
| Gemini Omni 1.1 | activado, sin interruptor | incluido | descríbelo en prosa |
| MiniMax H3 | siempre activado | incluido | etiquetas de diálogo y línea de paisaje sonoro |
| HappyHorse 1.0 / 1.1 | activado | incluido | nómbralo con palabras o sale casi mudo |
| FLUX 3 Video | activado, con interruptor | incluido | las líneas habladas exigen un hablante visible |
| Grok Imagine Video | siempre activado | incluido | nombra el sonido; la negación se ignora |
| Kling 3 (v3.0, O3) | activado | varía según el modo, visible en la estimación | etiquetas de hablante en el diálogo |
Todas tienen guía de prompts en su página del modelo; la sintaxis del audio es lo que más varía.
Tres cosas que saber antes de generar
- El silencio es un parámetro, no una frase. "Sin música" en el prompt no silencia un modelo: Grok y H3 lo ignoran y otros pueden invocar música. Usa el interruptor donde exista.
- El diálogo necesita un hablante visible en FLUX 3 Video, y funciona mejor así en todos: una línea entrecomillada sin nadie en pantalla puede salir como texto en pantalla.
- Veo sale mudo si no lo pides. Su interruptor de audio viene desactivado en LUVI porque cambia el precio; la estimación se actualiza al activarlo.
Alternativas con voz propia
Para una voz concreta, genera la locución con un modelo de texto a voz (ElevenLabs, Gemini TTS, MiniMax Speech, Grok Speech) y úsala en un modelo de sincronización labial. La duración del audio fija entonces el precio.
Preguntas frecuentes
¿Puedo desactivar el sonido?
Solo donde el modelo tiene interruptor: Veo y FLUX 3 Video tienen generate_audio. H3, Grok video y Gemini Omni siempre generan audio; en Seedance basta con no incluir el canal de audio en el prompt.
¿Por qué mi clip salió casi en silencio?
La mayoría de estos modelos necesitan que el sonido esté nombrado en el prompt. HappyHorse en particular devuelve casi silencio si no hay ninguna línea de audio escrita; la guía de prompts de la familia muestra la sintaxis.
¿Puedo agregar una pista de voz real en su lugar?
Sí: los modelos de sincronización labial como OmniHuman, VEED y sync toman tu propio archivo de audio y animan la boca a su ritmo.