Comment écrire un prompt pour Seedance 2.5, et pourquoi les réflexes hérités de Seedance 2.0 le font échouer

Seedance 2.5 lit des repères en secondes entières, des canaux audio typés et un seul mouvement de caméra par plan. La plupart des mauvais résultats viennent d’un prompt écrit comme pour Seedance 2.0. Voici la structure qui fonctionne, tirée du guide que nous appliquons dans LUVI.

Publié:

Cinq petites images de film alignées, chacune traversée d'un seul trait de lumière chaude, au-dessus d'une frise chronologique aux repères ambrés placés sur les secondes entières.

Seedance 2.5 est le modèle audio-vidéo conjoint de ByteDance : l’image et le son sortent d’un même rendu. Sur LUVI, il tourne en texte vers vidéo, en image vers vidéo et en référence vers vidéo, en 480p, 720p et 1080p, à partir de 3 030 crédits pour un clip de cinq secondes. C’est aussi la famille où les règles de prompt s’inversent le plus nettement d’une version à l’autre : plusieurs choses qui font loi sur Seedance 2.0 sont fausses sur la 2.5. Voici la structure que notre guide de prompt impose, et la raison derrière chaque règle.

La structure en quatre parties

Un prompt pour la 2.5 n’est pas une légende d’image. Il compte quatre parties, dans cet ordre :

  1. La ligne des ressources (modes avec média seulement). Numérotez chaque image, vidéo ou audio fourni, dans l’ordre d’import, et dites ce que chacun apporte : « @Image 1 defines the artist’s face, hair and dark green apron — only her face, hair and clothing, never its background. »
  2. Le résumé en une ligne. Sujet, lieu, événement, genre ou style, et tout mouvement de caméra particulier.
  3. Le corps en temps forts, découpé en secondes entières.
  4. L’audio, écrit comme un contenu dans des canaux typés.

Soixante à cent mots suffisent pour un seul temps fort. Un enchaînement de plans minuté tient en 150 à 250 mots. Le plafond strict est de 1 000 mots anglais, mais rien de bon ne se produit au-delà de 300.

Les repères temporels fonctionnent-ils sur Seedance 2.5 ?

Oui, et la documentation de ByteDance le dit sans détour : la 2.0 ne réagit pas aux repères temporels et ne répond qu’aux numéros de plan, la 2.5 prend en charge les repères en secondes entières. Trois formes sont respectées : les intervalles (« 0–3 seconds… 3–7 seconds… », continus, sans trou), les points (« at the 5-second mark ») et les repères relatifs (« after 3 seconds »).

L’en-tête hybride que ByteDance emploie dans ses exemples reste la forme la plus sûre pour un enchaînement de plans :

Shot 1 (0-3s): extreme wide shot, ultra-low camera position, a lone cyclist crests a ridge at golden hour…
Shot 2 (3-7s): medium close-up, the camera pushes in slowly…

Donnez à chaque intervalle assez de matière pour le remplir. Trop peu, et le modèle improvise. Trop, et des temps forts sautent.

Comment écrire l’audio ?

Le son est généré en même temps que l’image, vous l’écrivez donc au lieu de le demander, et chaque canal a son propre crochet : la musique entre parenthèses pleine largeur (…), les effets sonores entre chevrons ASCII <…>, les dialogues entre accolades ASCII {…}, les sous-titres à l’écran entre crochets lenticulaires 【…】. Les confondre est l’échec silencieux le plus courant : le modèle lit le mauvais canal et renvoie un son générique.

Le dialogue suit une formule, dans cet ordre : langue, accent ou variante régionale, jeu, locuteur, puis la réplique : says in English, calm and low, the older man {We should have left an hour ago}. Toute langue autre que le chinois ou l’anglais doit être étiquetée, et l’anglais gagne à l’être aussi. Une réplique sans étiquette dérive.

Combien de mouvements de caméra par plan ?

Un seul. La documentation le dit mot pour mot : « Do not require push, pull, pan, and move at the same time, as this will increase image instability. » Empilez les mouvements d’un temps fort à l’autre, jamais à l’intérieur d’un même plan, et gardez la caméra dans sa propre proposition pour que son déplacement ne soit jamais lu comme celui du sujet. Servez-vous du vocabulaire documenté (push in, pull out, pan, track, follow, orbit, dive, pull back, tilt up, handheld shake) et écrivez le cadrage comme une intention (« wide shot », « shallow focus »), jamais en focales ni en ouvertures : le modèle range tout par catégories, et sa propre documentation qualifie un 45 mm de grand-angle.

Existe-t-il un prompt négatif ?

Non, il n’y a pas de prompt négatif. « No cape » produit des capes. Décrivez plutôt l’état final : « the shoulder line is clean and unbroken. » Les seules négations qui fonctionnent concernent l’audio et les sous-titres (« no bgm », « no subtitles »), et même celles-là restent probabilistes. Ne composez donc jamais un texte à l’écran et une suppression de texte dans le même plan.

Qu’est-ce qui change par rapport à Seedance 2.0 ?

  • Le rythme. Seedance 2.0 : l’ordre des plans seulement, repères temporels ignorés. Seedance 2.5 : repères en secondes entières respectés.
  • La structure. 2.0 : un storyboard de plans. 2.5 : ligne des ressources → résumé → temps forts minutés → audio.
  • La caméra. Un mouvement par plan sur les deux : même loi.
  • L’audio. Canaux typés sur les deux : mêmes crochets.
  • Les résolutions sur LUVI. 2.0 : 480p → 4K (paliers de super-résolution). 2.5 : 480p, 720p, 1080p.

S’il ne fallait retenir qu’une chose : sur la 2.5, les secondes que vous écrivez sont les secondes que vous obtenez. Sur la 2.0, ce sont des décorations.

Dans LUVI

Activez l’interrupteur du guide de prompt dans l’espace de travail : votre brouillon est réécrit dans cette structure avant de partir au rendu. Claude et ChatGPT font de même par le connecteur, avec get_prompt_manual et check_prompt (comment connecter LUVI à Claude). L’ensemble des règles se trouve sur la page de la famille Seedance, et ce que coûte un clip est expliqué dans comment fonctionnent les crédits.

Questions

Seedance 2.5 génère-t-il le son ?

Oui, dans le même passage, et c’est activé par défaut. Écrivez le son comme un contenu dans les canaux typés plutôt que de le demander en prose.

Puis-je réutiliser mes prompts Seedance 2.0 sur la 2.5 ?

Rarement. La 2.0 rythme par numéro de plan et ignore les repères temporels, tandis que la 2.5 respecte les repères en secondes entières. Un storyboard écrit à la manière 2.0 tourne encore sur la 2.5, mais vous renoncez à son principal avantage.

Combien coûte un clip de 5 secondes ?

À partir de 3 030 crédits à la résolution de base sur LUVI. Le 720p et le 1080p coûtent davantage, et l’espace de travail affiche l’estimation exacte avant que vous ne confirmiez.

À lire aussi dans Guides