Cómo escribir prompts para HappyHorse: si no nombras el sonido, el clip sale mudo

HappyHorse genera imagen y sonido juntos, pero no deduce el sonido de lo que ve: un prompt sin una línea de audio devuelve un video casi mudo. También es de los pocos modelos de video que respeta los tiempos por toma, justo al revés que Seedance 2.5.

Publicado:

Sobre una línea de tiempo luminosa, en un estudio oscuro, hay cuatro cuadros panorámicos con marcas ámbar entre ellos; del segundo suben anillos cálidos de sonido y los otros tres llevan líneas planas y apagadas.

HappyHorse es el modelo de Alibaba que genera imagen y sonido en una sola pasada: el diálogo, los efectos y el ambiente salen junto con los cuadros, y la sincronización de labios trabaja a nivel de fonema. En LUVI funciona como texto a video, imagen a video, referencia a video y edición de video, en 720P o 1080P, de tres a quince segundos. Se cobra por segundo, así que la estimación en créditos aparece en el espacio de trabajo antes de generar, y 1080P cuesta más por segundo que 720P. Este modelo tiene dos reglas que no aparecen en ningún otro de nuestros manuales, y son exactamente el motivo por el que mucha gente lo abandona antes de tiempo.

¿Por qué mi clip salió casi mudo?

HappyHorse no deduce el sonido de lo que ve. Un prompt que describe una tormenta perfectamente, pero sin una frase que nombre el sonido, devuelve un video casi mudo, porque el audio se genera a partir de las palabras y no de la imagen. Sorprende justamente porque la documentación del proveedor no ayuda: la referencia de la API de texto a video no trae ninguna guía sobre audio y su prompt de ejemplo describe solo lo visual, una ciudad de cartón con un tren que la cruza.

Por eso el manual que usamos para esta familia exige una frase de sonido en cada corrección, escrita como contenido y no como promesa. Usa las tres capas que la escena realmente necesite.

  • Primer plano: el diálogo y el efecto principal del que trata la escena.
  • Capa media: el Foley atado a algo visible, como pasos, chisporroteo, agua o tela.
  • Fondo: ambiente, ruido de sala, música.

Escríbelo como su propia frase: Audio: rain on the awning, distant traffic, no music. Las exclusiones se ponen cortas y concretas al final, y aquí sí funcionan: "no music", "no dialogue", "no people in frame".

¿Cómo se escribe un diálogo que sincronice?

Marca el idioma de la línea, ponla entre comillas y, si no está en inglés, escríbela en su propia grafía. La sincronización trabaja a nivel de fonema y está entrenada sobre escritura real, así que escribir una frase "como suena" sincroniza peor que escribirla bien. El idioma del prompt no decide el habla: lo deciden la etiqueta y el texto entrecomillado.

A young woman in a red coat stands under a shop awning at night and looks straight into the camera, neon reflections on the wet pavement, one slow push-in. She says in German, "Der letzte Bus ist schon weg." Audio: rain on the awning, distant traffic, no music.

Qué idiomas sincronizan de verdad es donde las fuentes públicas no coinciden, y eso importa directamente si quieres hablar en español. El manual que LUVI usa para esta familia enumera siete idiomas para la versión 1.0 (inglés, mandarín, cantonés, japonés, coreano, alemán y francés) y anota que 1.1 amplía la lista. La página de fal para Happy Horse 1.1 dice "English, French, Spanish, Turkish, Japanese, and more", o sea que sí incluye el español. Nuestra revisión sigue el manual, así que trata el español como no comprobado por ahora: deja la línea muy corta, o cuenta la idea sin que nadie hable en cámara y pon el idioma en el fondo sonoro en vez de en la boca.

Con más de una persona hablando, numera los personajes y dale a cada turno su rango de tiempo: 0-4s: character1 says in French, "..."; 4-8s: character2 laughs and replies, "...". Mantén a quien habla de frente y las frases cortas.

¿Funcionan los tiempos por toma en HappyHorse?

Sí, y esta es la regla que hace que valga la pena aprender el modelo. Aquí los encabezados de toma con tiempos sí se respetan, que es lo contrario de lo que hace Seedance 2.5 con la misma sintaxis: esa familia avanza por orden de toma y sus marcas por segundo son inestables, como contamos en cómo escribir prompts para Seedance 2.5. Llevar la costumbre de un modelo al otro es la forma más común de quemar una generación en cualquiera de los dos.

Escribe las tomas como Shot N (framing, start-end s):, deja cada una en unos cinco segundos y cuida que la identidad se sostenga entre cortes.

Shot 1 (wide establishing, 0-5s): A fisherman in a yellow oilskin coat hauls a net over the rail of a small boat, overcast dawn light. Audio: gulls, wind, water against the hull. Shot 2 (medium, 5-10s): The same fisherman drinks from a steel flask in the wheelhouse, locked-off camera. Audio: engine hum under the cabin, the flask knocking against the console.

Deja las tomas cortas y la física escrita. Los planos largos pierden consistencia espacial, la física no escrita se rompe de maneras conocidas (puertas que se cierran solas, agua que corre a la velocidad equivocada) y la acción rápida borronea el detalle fino del vestuario.

¿Cuánto puede medir el prompt?

El límite del proveedor es generoso y no avisa. La referencia de la API de texto a video de Alibaba Cloud dice: "Maximum 5,000 non-Chinese characters or 2,500 Chinese characters. Excess is truncated." Es decir que un prompt largo en inglés no se rechaza: se le corta la cola, y eso es peor, porque el sonido suele ir al final.

La revisión de LUVI avisa antes, a los 2500 caracteres, que es la lectura prudente de ese mismo límite. En la práctica el techo que importa está mucho más abajo: una sola toma quiere entre 20 y 60 palabras, porque un prompt largo diluye su propio control, las caras se van hacia un promedio genérico y las manos pierden geometría.

¿Qué empeora un prompt de HappyHorse?

Cuatro costumbres, todas traídas de los modelos de imagen, y las cuatro medibles en la revisión.

  • Adjetivos de elogio. "Masterpiece", "ultra-detailed" e "hyperrealistic" son palabras muertas en este modelo: en el mejor caso inertes, en el peor dañinas. Cámbialas por lenguaje de cámara: "overcast daylight, wet asphalt, neon pink and cyan reflections in the puddles, 35mm telephoto, shallow depth of field".
  • Indicaciones de cámara apiladas. Una sola por toma: un lente, o una receta de luz, o un movimiento. Cinco juntas se anulan entre sí. Deja la cámara en su propia frase para que su movimiento no se lea como el del personaje.
  • Coreografía de más. Una acción principal, descrita con limpieza. "A child runs through a field" rinde mejor que esa misma frase rellena de pelo, polvo y braceo.
  • Pesos y proporciones. No hay cfg ni sintaxis de pesos, y la proporción es un parámetro con nueve valores: escribir "16:9" en el prompt no hace nada.

Cómo lo verificamos

  • Modelos: alibaba/happyhorse-1.1/text-to-video, /image-to-video y /reference-to-video, más alibaba/happyhorse-1.0/video-edit.
  • Ajustes: de tres a quince segundos, 720P y 1080P, las nueve proporciones del esquema y el modo de referencia con hasta nueve imágenes.
  • Fecha y qué se leyó: 22 de septiembre de 2026. Los esquemas de los modelos y las estimaciones de créditos en LUVI, la guía de prompts que LUVI aplica a esta familia, la referencia de la API de Alibaba Cloud y la página de fal enlazada arriba.
  • Resultados: el esquema y la documentación del proveedor coinciden en la duración (3 a 15 s, con 5 por defecto) y en las nueve proporciones. El límite del prompt citado arriba es la frase textual del proveedor. Las listas de idiomas de las dos fuentes públicas no coinciden, y el artículo lo dice en vez de elegir una.
  • Limitaciones: No se generó ninguna salida para este artículo, así que no afirma nada sobre la calidad del resultado. Los créditos cambian cuando el proveedor ajusta su precio: mira la estimación del espacio de trabajo antes de un clip largo.

En LUVI

Elige HappyHorse en el espacio de trabajo y toca el botón de la pluma antes de generar. Es LuviTransLex, la revisión gratuita que aplica la guía de prompts de esta familia.

Con este modelo la revisión es dura, porque HappyHorse tiene una lista publicada de palabras que conviene evitar. Pasa este prompt: A beautiful woman walking in a stunning city, masterpiece, ultra-detailed, hyperrealistic, epic cinematic lighting, 16:9, (neon:1.3), slow motion handheld orbit push-in with a zoom and a shake. Vuelve con dos correcciones y cuatro advertencias: "masterpiece", "ultra-detailed" e "hyperrealistic" se borran, "beautiful", "stunning" y "epic" quedan marcadas como etiquetas muertas de calidad, la proporción se marca por ser un parámetro, y el peso se cae mientras neon se conserva. Lo que queda todavía apila indicaciones de cámara, y esa parte la reduces a una sola a mano.

El modo de referencia acepta hasta nueve imágenes, así que es el indicado cuando un personaje tiene que seguir siendo reconocible: dirígete a las personas de referencia como character1 y character2, y amarra la identidad con palabras. También puedes manejar todo desde Claude o ChatGPT con el conector de LUVI.

¿Recién llegas? Crea una cuenta de LUVI y prueba primero un clip de tres segundos: es la forma más barata de escuchar si tu línea de audio funcionó.

Fuentes

Más de Guías