Comment écrire un prompt pour Wan 3.0 : sans caméra nommée, le modèle coupe tout seul
Wan 3.0 lit une formule qui s’additionne : entité, décor, mouvement, puis l’optique, puis le son. L’audio est généré dans le même passage. Sans caméra nommée à chaque plan, le modèle coupe au milieu du clip. Cinq secondes démarrent à 400 crédits en 480p.

Wan 3.0 est le modèle d’Alibaba qui génère l’image et le son ensemble, et sur LUVI il ouvre la famille de modèles la plus fournie du catalogue. Il existe en texte vers vidéo, image vers vidéo et référence vers vidéo, produit des clips de 2 à 30 secondes et sort en 480p, 720p ou 1080p. Le 22 septembre 2026, nos devis donnaient 400 crédits pour cinq secondes en 480p, 800 en 720p et 1 600 en 1080p ; les modèles Wan 3.0 Prime, plus fidèles, affichaient 2 520 crédits pour cinq secondes en 1080p. Voici comment le modèle lit un prompt, en commençant par le raté qui nous est signalé le plus souvent.
Pourquoi mon clip a-t-il coupé au milieu ?
Wan coupe parce que rien dans votre prompt ne lui a dit comment tenir le cadre. Le guide d’Alibaba demande de nommer le traitement de caméra de chaque plan, et le guide de prompts que LUVI a rédigé pour cette famille en tire la conséquence sans détour : si la caméra n’est pas nommée, Wan monte à votre place et coupe à l’intérieur d’un même clip. La correction tient en une formule par plan – « caméra fixe », « lent travelling avant », « plan en filature » – et un seul mouvement principal, jamais deux dans le même plan.
Cela compte, parce que Wan dispose d’une manière reconnue de vous donner plusieurs plans, et cette manière n’est pas le silence. Dans sa liste de ce qu’il ne faut pas demander, Alibaba cite les changements de scène rapides à l’intérieur d’un clip et en donne la raison : les coupes se font entre les clips, pas dedans, et un clip est une seule prise continue. Si vous voulez des plans, vous les numérotez.
Comment écrire plusieurs plans ?
Avec la formule multiplan, dont Wan 3.0 respecte les repères temporels. Alibaba en donne la forme : description générale, numéro de plan, repère temporel, contenu du plan, sur le modèle Shot 1 [0–3 s] xxxx, Shot 2 [3–6 s] xxx. La description générale porte une seule fois l’histoire et l’allure du personnage, ce qui vous évite de le redécrire à chaque plan ; chaque plan énonce ensuite son cadre, son mouvement de caméra et sa transition.
Overall: a quiet winter morning in a mountain village, warm and unhurried, one woman throughout. Shot 1 [0–4 s] A woman in a thick grey wool coat unlatches a wooden gate with one gloved hand, her breath clouding; medium shot, soft overcast light from the left, fixed camera. Shot 2 [4–8 s] Hard cut transition. The same woman walks down a snow-dusted lane toward the camera; wide shot, slow push-in, low winter sun behind her. Sound effects: boots compressing fresh snow, the iron latch clicking open, distant crows calling. No dialogue. No background music.
Le prompt reste en anglais : les langues prises en charge par Wan sont le chinois et l’anglais. Quatre à six secondes par plan constituent la plage qui fonctionne, et un repère temporel qui dépasse la durée du clip est perdu, alors gardez le dernier à l’intérieur des secondes que vous avez réglées.
À quoi ressemble le reste du prompt ?
À une formule qui s’additionne dans l’ordre, pas à un empilement de mots-clés. Alibaba la publie ainsi : « entité (description) + décor (description) + mouvement (description) + contrôle esthétique + stylisation ». Et le guide ne mâche pas ses mots sur ce qui arrive quand on s’arrête aux trois premiers éléments : les prompts faibles couvrent l’entité et le mouvement mais sautent le contrôle esthétique et la stylisation, ce qui donne une caméra statique dans un vide sans définition.
- Entité. Qui ou quoi, résolu par son apparence : « une jeune femme aux cheveux auburn ondulés, en robe à fleurs vintage ».
- Décor. L’environnement, premier plan et arrière-plan compris.
- Mouvement. Ce qui bouge, de combien, à quelle vitesse : « oscille violemment », « avance lentement ».
- Contrôle esthétique. Source lumineuse, éclairage, échelle de plan, angle, objectif, mouvement de caméra. C’est exactement la case que les prompts faibles laissent vide.
- Stylisation. Un seul mot de style : cyberpunk, illustration au trait, pâte à modeler, feutrine, pixel. Pas d’empilement.
Comment écrire le son ?
Vous le décrivez comme un contenu, parce que Wan 3.0 génère l’audio dans le même passage et que son paramètre audio est actif par défaut. Le couper ne rend pas le clip moins cher : le contrat du modèle indique que le prix est identique dans les deux cas. Alibaba découpe le son en trois formules : la voix, c’est la réplique plus l’émotion, le ton, le débit, le timbre et l’accent ; l’effet, c’est la matière source plus l’action et l’ambiance ; la musique, c’est la partition plus le style. Les répliques vont entre guillemets droits, comme tout texte devant apparaître à l’écran.
Les modèles vidéo de Wan n’ont pas de prompt négatif : les exclusions s’écrivent donc en fin de prompt, sous forme de phrases – « No dialogue. » « No background music. » « No on-screen text, no subtitles. » Si vous ne savez pas quels modèles du catalogue disposent de ce champ, le centre d’aide précise quand le champ de prompt négatif apparaît.
Comment désigner une image ou une vidéo que j’ai importée ?
Par son type et son rang. La règle d’Alibaba est littérale : pour les images on écrit « Image n », pour les vidéos « Video n ». Images et vidéos sont numérotées séparément, dans l’ordre d’import, et l’identifiant sert de nom dans la phrase : « The cat in Image 1 plays in the room in Image 2. » En anglais, le guide demande une majuscule et une espace entre le mot et le chiffre.
L’espace de travail de LUVI insère sa propre étiquette, @Image 1, quand vous joignez une référence. Gardez-la et écrivez la forme de Wan à côté, la première fois. Une vidéo de référence prête à la fois l’apparence, le mouvement et le timbre de voix : dites dans la phrase lequel des trois vous voulez en tirer.
Qu’est-ce qui va dans les paramètres plutôt que dans le prompt ?
Quatre choses, et les écrire dans le texte revient à gaspiller des mots : duration (de 2 à 30 secondes, 5 par défaut), resolution (480p, 720p, 1080p), ratio (« adaptive » par défaut, ou 16:9, 4:3, 1:1, 3:4, 9:16) et audio. N’écrivez jamais « 16:9 », « 1080p » ni « 10 secondes » dans le prompt lui-même.
Deux d’entre eux déplacent le prix. La durée est facturée à la seconde et la résolution multiplie ce tarif : pour les mêmes cinq secondes, nos trois devis sont montés à 400, 800 puis 1 600 crédits à mesure que la résolution augmentait. Le centre d’aide explique comment la résolution et la durée font varier le prix sur l’ensemble du catalogue.
Comment nous avons vérifié
- Modèles : Wan 3.0 Texte vers vidéo, Image vers vidéo et Référence vers vidéo, ainsi que Wan 3.0 Prime Texte vers vidéo.
- Réglages : clips de cinq secondes en 480p, 720p et 1080p, en 16:9.
- Date et sources lues : 22 septembre 2026. Les contrats de paramètres des modèles et les devis en crédits obtenus en direct dans LUVI, le guide de prompts rédigé par LUVI pour la famille Wan, et le guide de prompts texte vers vidéo d’Alibaba Cloud (dernière mise à jour : 4 septembre 2026).
- Résultats : 400, 800 et 1 600 crédits pour cinq secondes en 480p, 720p et 1080p ; 2 520 crédits pour Wan 3.0 Prime en 1080p. Aucune sortie n’a été générée pour cet article, qui n’avance donc rien sur la qualité des résultats.
- Limites : la plage de quatre à six secondes par plan et le comportement d’une caméra non nommée viennent du guide de prompts de LUVI, pas d’un test publié.
Dans LUVI
Choisissez un modèle sur la page de la famille Wan, écrivez la formule dans l’ordre et vérifiez-la avant de dépenser quoi que ce soit : le bouton en forme de plume, à côté du champ de prompt, applique le guide de prompts du modèle sélectionné et réécrit le texte dans son dialecte. Joignez vos références comme l’explique la fiche comment utiliser des images, des vidéos et des sons de référence, puis regardez l’estimation en crédits affichée au-dessus du bouton Générer : ce montant est un plafond, pas une approximation.
Si vous préférez piloter tout cela depuis une fenêtre de discussion, le connecteur de LUVI ouvre les mêmes modèles et les mêmes guides de prompts à Claude et à ChatGPT ; la documentation MCP détaille l’installation. Les nouveaux comptes démarrent avec 1 000 crédits : vous pouvez donc créer un compte LUVI et lancer l’exemple ci-dessus sans rien acheter.
Sources
- Guide de prompts texte vers vidéo et image vers vidéo (en anglais) – Alibaba Cloud Model Studio, documentation officielle, dernière mise à jour le 4 septembre 2026. Consulté le 22 septembre 2026.
À lire aussi dans Guides
- Comment écrire un prompt pour Hailuo : quinze commandes de caméra entre crochetsHailuo reçoit sa direction de caméra sous forme de commande entre crochets, prise dans une liste fermée de quinze et posée là où le mouvement a lieu. Le modèle ne produit que l’image : chaque mot consacré au son est perdu. Six secondes démarrent à 380 crédits.
- Hunyuan3D ne lit pas votre prompt : en image vers 3D, tout le brief est la photoSur les modes image vers 3D de Hunyuan3D, le champ de texte n'est pas lu : le contrat du modèle indique qu'il n'accepte aucun prompt. Tout votre contrôle tient à la préparation de l'image d'entrée. Les maillages démarrent à 600 crédits sur Rapid et 1 000 sur Pro.
- Seedream 5.0 Pro : pourquoi écrire « 16:9 » dans le prompt ne sert à rienSeedream 5.0 Pro n'a pas de paramètre de format. La forme de l'image se règle dans size, écrit LARGEUR*HAUTEUR avec une astérisque, et un format tapé dans le texte est ignoré. Voici les treize tailles valides, l'interrupteur thinking et la phrase que le modèle récompense. À partir de 144 crédits.