Comment écrire un prompt HappyHorse : sans ligne de son, le clip revient muet
HappyHorse fabrique l'image et le son ensemble, mais il ne déduit pas le son de ce qu'il voit : un prompt sans ligne audio renvoie une vidéo quasi muette. C'est aussi l'un des rares modèles vidéo à respecter les repères temporels des plans, exactement l'inverse de Seedance 2.5.

HappyHorse est le modèle d'Alibaba qui fabrique l'image et le son en une seule passe : dialogue, effets et ambiance sortent avec les images, et la synchronisation labiale travaille au niveau du phonème. Le français fait partie des sept langues que notre manuel donne comme synchronisées, ce qui n'est pas si courant. Sur LUVI, le modèle existe en texte vers vidéo, image vers vidéo, référence vers vidéo et retouche vidéo, en 720P ou 1080P, de trois à quinze secondes. La facturation se fait à la seconde : l'estimation en crédits s'affiche dans l'espace de travail avant le lancement, et la seconde coûte plus cher en 1080P qu'en 720P. Deux de ses règles n'apparaissent dans aucun autre de nos manuels, et ce sont précisément elles qui font abandonner le modèle trop tôt.
Pourquoi mon clip est-il revenu presque muet ?
HappyHorse ne déduit pas le son de ce qu'il voit. Un prompt qui décrit parfaitement un orage, mais sans une phrase qui nomme le son, renvoie une vidéo quasi muette, parce que l'audio se fabrique à partir des mots et non de l'image. La surprise vient de la documentation elle-même : la référence de l'API texte vers vidéo ne donne aucune consigne sur l'audio, et son prompt d'exemple ne décrit que le visuel, une ville en carton traversée par un train.
Le manuel que nous appliquons à cette famille impose donc une ligne de son à chaque réécriture, écrite comme un contenu et non comme une promesse. Servez-vous des trois couches dont la scène a réellement besoin.
- Premier plan : le dialogue et l'effet principal dont la scène parle.
- Couche intermédiaire : les bruitages accrochés à quelque chose de visible, pas, grésillement, eau, tissu.
- Arrière-plan : ambiance, son de salle, musique.
Écrivez-la comme une phrase à part : Audio: rain on the awning, distant traffic, no music. Les exclusions se glissent en fin de prompt, courtes et concrètes, et elles fonctionnent ici : « no music », « no dialogue », « no people in frame ».
Comment écrire un dialogue qui se synchronise ?
Indiquez la langue de la réplique, mettez-la entre guillemets et, si elle n'est pas en anglais, écrivez-la dans sa propre orthographe. La synchronisation travaille au niveau du phonème et a été entraînée sur de l'écrit réel : transcrire une phrase « comme elle se prononce » se synchronise moins bien que l'écrire correctement. La langue du prompt ne décide pas de la parole, ce sont l'étiquette et le texte entre guillemets qui décident.
A young woman in a red coat stands under a shop awning at night and looks straight into the camera, neon reflections on the wet pavement, one slow push-in. She says in German, "Der letzte Bus ist schon weg." Audio: rain on the awning, distant traffic, no music.
Sur la liste exacte des langues, les sources publiques divergent. Le manuel que LUVI applique à cette famille en cite sept pour la version 1.0, anglais, mandarin, cantonais, japonais, coréen, allemand et français, et note que la 1.1 élargit l'ensemble. La page fal de Happy Horse 1.1 annonce « English, French, Spanish, Turkish, Japanese, and more ». Les deux s'accordent sur le français, c'est donc la bonne nouvelle pour vous ; pour toute autre langue absente des sept, gardez la réplique très courte ou faites passer le sens sans parole à l'image.
Avec plusieurs personnes qui parlent, numérotez les personnages et donnez à chaque tour sa plage de temps : 0-4s: character1 says in French, "..."; 4-8s: character2 laughs and replies, "...". Gardez celui qui parle de face et les répliques brèves.
Les repères temporels fonctionnent-ils sur HappyHorse ?
Oui, et c'est la règle qui rend ce modèle intéressant à apprendre. Les en-têtes de plan avec repères temporels sont respectés ici, à l'inverse de ce que fait Seedance 2.5 avec la même syntaxe : cette famille avance par ordre de plan et ses marques à la seconde sont instables, comme nous l'expliquions dans comment écrire un prompt pour Seedance 2.5. Transporter l'habitude d'un modèle vers l'autre reste la façon la plus courante de gâcher une génération, dans les deux sens.
Écrivez les plans sous la forme Shot N (framing, start-end s):, tenez chacun autour de cinq secondes et veillez à ce que l'identité tienne d'un plan à l'autre.
Shot 1 (wide establishing, 0-5s): A fisherman in a yellow oilskin coat hauls a net over the rail of a small boat, overcast dawn light. Audio: gulls, wind, water against the hull. Shot 2 (medium, 5-10s): The same fisherman drinks from a steel flask in the wheelhouse, locked-off camera. Audio: engine hum under the cabin, the flask knocking against the console.
Gardez les plans courts et écrivez la physique. Les plans longs perdent la cohérence de l'espace, une physique non écrite casse de façons connues, portes qui se ferment seules, eau qui coule à la mauvaise vitesse, et l'action rapide brouille le détail fin des costumes.
Quelle longueur de prompt est admise ?
La limite de l'éditeur est large et ne prévient pas. La référence de l'API texte vers vidéo d'Alibaba Cloud indique : « Maximum 5,000 non-Chinese characters or 2,500 Chinese characters. Excess is truncated. » Un prompt anglais trop long n'est donc pas refusé : sa fin est coupée en silence, ce qui est pire, puisque le son s'écrit en général à la fin.
La vérification de LUVI avertit plus tôt, à 2 500 caractères, soit la lecture prudente de cette même limite. Dans les faits, le plafond utile se situe bien plus bas : un plan unique demande 20 à 60 mots, parce qu'un prompt qui s'allonge dilue son propre contrôle, les visages glissent vers une moyenne générique et les mains perdent leur géométrie.
Qu'est-ce qui dégrade un prompt HappyHorse ?
Quatre habitudes, toutes venues des modèles d'image, et toutes mesurables dans la vérification.
- Les adjectifs de louange. « Masterpiece », « ultra-detailed » et « hyperrealistic » sont des mots morts sur ce modèle : inertes au mieux, nuisibles au pire. Remplacez-les par du vocabulaire de prise de vue : « overcast daylight, wet asphalt, neon pink and cyan reflections in the puddles, 35mm telephoto, shallow depth of field ».
- Les indications de caméra empilées. Une seule par plan : un objectif, ou une recette de lumière, ou un mouvement. Cinq d'un coup s'annulent. Laissez la caméra dans sa propre proposition pour que son mouvement ne soit pas lu comme celui du personnage.
- La chorégraphie de trop. Une action principale, décrite proprement. « A child runs through a field » donne un meilleur résultat que la même phrase rembourrée de cheveux, de poussière et de bras qui balancent.
- Les poids et les formats. Il n'y a ni cfg ni syntaxe de pondération, et le format est un paramètre à neuf valeurs : écrire « 16:9 » dans le prompt ne produit rien.
Ce que nous avons vérifié
- Modèles :
alibaba/happyhorse-1.1/text-to-video,/image-to-videoet/reference-to-video, ainsi quealibaba/happyhorse-1.0/video-edit. - Réglages : de trois à quinze secondes, 720P et 1080P, les neuf formats exposés par le schéma, et le mode référence qui accepte jusqu'à neuf images.
- Date et sources lues : 22 septembre 2026. Les schémas des modèles et les estimations en crédits sur LUVI, le guide de prompt appliqué à cette famille, la référence d'API d'Alibaba Cloud et la page fal citée plus haut.
- Résultats : le schéma et la documentation de l'éditeur concordent sur la durée (3 à 15 s, 5 par défaut) et sur les neuf formats. La limite de prompt citée est la formulation exacte de l'éditeur. Les listes de langues des deux sources publiques ne coïncident pas, et l'article le dit au lieu d'en choisir une.
- Limites : Aucune génération n'a été produite pour cet article, il n'avance donc rien sur la qualité des résultats. Les crédits bougent quand le fournisseur change son tarif : regardez l'estimation affichée dans l'espace de travail avant un clip long.
Sur LUVI
Choisissez HappyHorse dans l'espace de travail et appuyez sur le bouton plume avant de générer. C'est LuviTransLex, la vérification gratuite qui applique le guide de prompt de cette famille.
Elle est sévère avec ce modèle, car HappyHorse possède une liste publiée de mots à éviter. Passez-lui ceci : A beautiful woman walking in a stunning city, masterpiece, ultra-detailed, hyperrealistic, epic cinematic lighting, 16:9, (neon:1.3), slow motion handheld orbit push-in with a zoom and a shake. Vous récupérez deux corrections et quatre avertissements : « masterpiece », « ultra-detailed » et « hyperrealistic » sont supprimés, « beautiful », « stunning » et « epic » sont signalés comme étiquettes de qualité mortes, le format est signalé parce que c'est un paramètre, et le poids tombe tandis que neon est conservé. Ce qui reste empile encore des indications de caméra : cette partie-là, vous la ramenez à une seule à la main.
Le mode référence accepte jusqu'à neuf images, c'est donc celui à choisir quand un personnage doit rester reconnaissable : adressez-vous aux personnes fournies avec character1 et character2, et fixez l'identité par les mots. Vous pouvez aussi tout piloter depuis Claude ou ChatGPT avec le connecteur LUVI.
Vous débutez ? Créez un compte LUVI et commencez par un clip de trois secondes : c'est la façon la moins chère d'entendre si votre ligne de son a pris.
Sources
- Référence de l'API texte vers vidéo de HappyHorse – Alibaba Cloud Model Studio, documentation d'API (en anglais). Consulté le 22 septembre 2026.
- Index de la documentation HappyHorse – Alibaba Cloud Model Studio, index de documentation (en anglais). Consulté le 22 septembre 2026.
- Happy Horse 1.1 (texte vers vidéo) – fal, page du modèle (en anglais). Consulté le 22 septembre 2026.
À lire aussi dans Guides
- Comment écrire un prompt pour Hailuo : quinze commandes de caméra entre crochetsHailuo reçoit sa direction de caméra sous forme de commande entre crochets, prise dans une liste fermée de quinze et posée là où le mouvement a lieu. Le modèle ne produit que l’image : chaque mot consacré au son est perdu. Six secondes démarrent à 380 crédits.
- Comment écrire un prompt pour Wan 3.0 : sans caméra nommée, le modèle coupe tout seulWan 3.0 lit une formule qui s’additionne : entité, décor, mouvement, puis l’optique, puis le son. L’audio est généré dans le même passage. Sans caméra nommée à chaque plan, le modèle coupe au milieu du clip. Cinq secondes démarrent à 400 crédits en 480p.
- Hunyuan3D ne lit pas votre prompt : en image vers 3D, tout le brief est la photoSur les modes image vers 3D de Hunyuan3D, le champ de texte n'est pas lu : le contrat du modèle indique qu'il n'accepte aucun prompt. Tout votre contrôle tient à la préparation de l'image d'entrée. Les maillages démarrent à 600 crédits sur Rapid et 1 000 sur Pro.