Comment écrire un prompt FLUX 3 Video : pourquoi votre dialogue s'est affiché en texte à l'écran

FLUX 3 Video fabrique l'image et le son en une seule passe : l'audio s'écrit donc dans le prompt au lieu de s'activer. Mettez chaque réplique entre guillemets et donnez-lui quelqu'un de visible pour la dire, sinon elle peut s'afficher en texte sur l'image. Sur LUVI, à partir de 1 870 crédits.

Publié:

Dans un décor sombre, la silhouette d'une personne parle tandis que des anneaux de son chaleureux se propagent ; devant elle flotte une plaque de verre vierge et, au fond, deux cadres panoramiques se rejoignent sur une couture turquoise lumineuse.

FLUX 3 Video est le modèle de Black Forest Labs qui fabrique l'image et le son dans la même passe : dialogue synchronisé sur les lèvres, ambiance, effets et musique arrivent avec les images. Le français figure dans la liste des langues prises en charge pour la synchronisation labiale, vous pouvez donc faire parler un personnage en français. Sur LUVI, le modèle existe en texte vers vidéo, image vers vidéo, images clés vers vidéo et prolongation de vidéo, en 720p ou 1080p, de cinq à vingt secondes, à partir de 1 870 crédits pour un clip de cinq secondes en 720p. La page de l'éditeur vous dit ce que le modèle sait faire. Cet article explique comment il lit un prompt, en commençant par l'erreur qui coûte le plus de générations.

Pourquoi mon dialogue s'est-il affiché en texte sur l'image ?

Une réplique entre guillemets sans personne de visible pour la dire peut s'afficher en texte incrusté au lieu d'être entendue. C'est le défaut le mieux documenté du modèle, et il découle d'une qualité que Black Forest Labs met en avant : FLUX 3 sait « render typography as a natural part of the scene », autrement dit intégrer la typographie comme un élément naturel du décor. Le modèle écrit vraiment bien à l'écran, et une citation sans propriétaire lui reste donc ambiguë : réplique à dire, ou phrase à montrer ?

Le manuel que LUVI applique à cette famille pose la règle sans détour : le dialogue s'écrit entre guillemets et s'attribue à quelqu'un de visible. Concrètement, cela tient en trois points.

  • Mettez un visage dans le cadre. Une personne visible donne au modèle une bouche à synchroniser. « Elle dit : … » vaut toujours mieux qu'une citation qui flotte.
  • Écrivez le mot « voiceover » ou « narration » quand la voix vient volontairement du hors-champ. Sans ce mot, la citation tombe exactement dans le cas ambigu.
  • Indiquez la langue et gardez la réplique courte. Black Forest Labs énumère la synchronisation labiale pour « English (various dialects), Chinese, Spanish, French, German, Japanese, Portuguese, Russian, Italian, Indonesian, Turkish, Hindi, Punjabi and more ». Une réplique courte dans un clip long tient mieux qu'un texte écrit pour remplir chaque seconde.

Si vous ne voulez rien d'écrit à l'écran, la négation fonctionne ici pour les éléments graphiques : « No on-screen text, no subtitles. »

Comment écrit-on le son ?

Sur FLUX 3 Video, le son est un contenu que vous écrivez et non un niveau que vous montez, et il se range en quatre couches : la parole, l'ambiance, les effets rattachés à une action visible, et la musique avec sa place dans le mixage. Demander les quatre est en général une erreur, car un mixage chargé est un défaut documenté. Une ou deux couches suffisent la plupart du temps.

Un piège a été mesuré. Sur dix clips générés avec cette famille, chaque mixage fait uniquement d'ambiance et d'effets s'est situé entre -36 et -61 LUFS, et le bas de cette plage équivaut au silence. À l'inverse, chaque clip portant un dialogue ou un lit musical est resté entre -18 et -32 LUFS. Nommer les sons est donc nécessaire mais pas suffisant : un mixage sans premier plan glisse vers l'inaudible. Quand le son compte et que personne ne parle, donnez au clip une indication musicale et précisez où cette musique se place.

Medium shot of a barista in a green apron sliding a paper cup across the counter toward the customer in front of her, slow dolly in, warm morning light through the window. She says in English, "Careful, it's very hot." Ambience: low cafe chatter and the hiss of a steam wand. The cup clicks against the saucer when she sets it down. No on-screen text, no subtitles.

Mieux vaut rédiger le prompt en anglais, parce que la documentation de l'éditeur est construite dans cette langue. Si la réplique doit être en français, laissez-la en français entre guillemets et précisez la langue : She says in French, "Attention, c'est brûlant."

Peut-on demander un clip silencieux ?

Pas dans le texte du prompt. Demander « quiet room tone » ou « complete silence » peut se traduire par du souffle ou du vide, parce que vous continuez de demander au modèle audio de produire quelque chose. Le silence complet, c'est le paramètre generate_audio, que vous coupez dans l'espace de travail. Le silence partiel s'écrit en revanche très bien comme contenu, puisqu'il décrit un mixage au lieu de le nier : « for the final two seconds, only rain against the window. »

Sur LUVI, couper le son ne change pas ce que vous payez. Un clip de cinq secondes en 720p est estimé à 1 870 crédits avec generate_audio activé et à 1 870 crédits une fois coupé (vérifié le 22 septembre 2026). C'est utile à savoir, parce que ce n'est pas la règle partout : sur Veo 3.1, le même paramètre est désactivé par défaut et la description du modèle précise que l'audio « augmente le coût à la seconde ».

Comment obtenir plusieurs plans dans un seul clip ?

Enchaîner plusieurs plans dans une même génération est le point fort du modèle, et la coupe s'écrit HARD CUT. Vous écrivez « SHOT ONE : … HARD CUT. SHOT TWO : … », vous répétez la description du personnage mot pour mot dans chaque plan, et vous nommez un seul lit sonore pour tout le clip.

Cela pèse plus qu'il n'y paraît. FLUX 3 Video n'a ni seed ni mode brouillon : deux envois identiques donnent deux résultats totalement différents, et aucune référence de style ne transporte un personnage d'une génération à l'autre. Une seule génération à plusieurs plans reste le seul endroit où la continuité est tenue par le modèle et non espérée par le prompt.

Les repères temporels ordonnent, ils ne marquent pas. Dans notre test, un HARD CUT unique écrit à 5,0 s d'un clip de dix secondes est ressorti en deux coupes, à 1,46 s et à 7,71 s, alors que l'ordre des plans, l'identité du personnage et la place du dialogue ont tenu. Écrivez une ligne de temps quand l'ordre compte, mais ne vous promettez jamais une coupe à l'image près.

SHOT ONE: A fisherman in a yellow oilskin coat hauls a dripping net over the rail of a small wooden boat, slow tracking shot, gray dawn light. HARD CUT. SHOT TWO: A fisherman in a yellow oilskin coat drinks from a steel flask in the wheelhouse, locked-on medium shot, gray dawn light. Music: a slow low cello bed under the whole clip. Ambience: gulls, wind, and water knocking against the hull.

Quelles habitudes venues des modèles d'image ne marchent pas ici ?

Le vocabulaire photo qui fonctionne sur les modèles d'image FLUX n'a aucun effet documenté sur FLUX 3 Video, et les paramètres ne sont pas des mots.

  • Ni ouvertures, ni pellicules, ni boîtiers, ni codes hexadécimaux. Décrivez plutôt la technique : « shallow (sharp on subject, blurred background) », « fine grain adds gritty, tactile realism », « amber, cream, walnut ».
  • Ni poids ni cfg. (melancholy:1.4) n'est pas lu ; la parenthèse n'est qu'un bruit autour d'un mot que le modèle aurait pris de toute façon.
  • Pas de champ de prompt négatif. Les exclusions restent permises, mais uniquement pour les couches audio et les éléments à l'écran : « no music, no second voice », « No on-screen text, no subtitles. » N'essayez jamais d'atteindre le silence par la négation.
  • Format, résolution et durée sont des paramètres. Écrire « 16:9 », « 1080p » ou « 10 seconds » dans le prompt ne produit rien.
  • Employez les termes de caméra que le modèle connaît. « Dolly in », « push through », « dolly zoom », « trucking », « arc shot », « pedestal », « locked-on ». « Zoom » tout court et « push-in » ne sont pas des termes documentés. Un terme de cadre, un terme de mouvement et une action par phrase : « low tracking shot » se comprend, « low aerial handheld orbit push-in » presque jamais.

Ce que nous avons vérifié

  • Modèles : black-forest-labs/flux-3/text-to-video et black-forest-labs/flux-3/image-to-video, plus les variantes de prolongation et d'images clés pour les prix.
  • Réglages : de cinq à vingt secondes, 720p et 1080p, generate_audio activé puis coupé.
  • Date et sources lues : 22 septembre 2026. Les schémas des modèles et les estimations en crédits sur LUVI, le guide de prompt que LUVI applique à cette famille, et les pages de Black Forest Labs citées plus bas.
  • Résultats : 1 870 crédits pour cinq secondes en 720p, son activé ou coupé ; 6 380 crédits pour dix secondes en 1080p ; 7 480 crédits pour vingt secondes en 720p. La plage de LUFS et la mesure des coupes viennent de dix clips générés avec cette famille pendant la rédaction du guide.
  • Limites : Aucune génération n'a été produite pour cet article, il n'avance donc rien sur la qualité des résultats. Les crédits bougent quand le fournisseur change son tarif : regardez l'estimation affichée dans l'espace de travail avant un clip long.

Sur LUVI

Choisissez FLUX 3 Video dans l'espace de travail, écrivez le prompt, puis appuyez sur le bouton plume juste à côté avant de générer. Ce bouton, c'est LuviTransLex, la vérification gratuite qui applique le guide de prompt de ce modèle et corrige ce qu'elle peut.

Elle vaut le détour même sur un prompt qui semble propre. Celui-ci a l'air soigné : A man sits alone at a kitchen table, 16:9, 1080p, shot on Kodak Portra at f/1.8, (melancholy:1.4), quiet room tone, #1a1a1a shadows, 10 seconds. La vérification renvoie une correction et huit avertissements : le poids est retiré et le mot conservé, la pellicule et l'ouverture sont signalées comme vocabulaire d'image, le code hexadécimal est signalé, le format, la résolution et la durée sont signalés parce que ce sont des paramètres, et la demande de silence est signalée. Vérifier et corriger ne coûte aucun crédit.

FLUX 3 Video n'a pas de champ de prompt négatif, et c'est pour cela qu'il n'apparaît pas dans son panneau : savoir quand ce champ existe dépend du modèle, pas d'un réglage. Vous pouvez aussi tout piloter depuis Claude ou ChatGPT avec le connecteur LUVI.

Vous débutez ? Créez un compte LUVI : les crédits offerts à l'inscription suffisent pour essayer un clip court.

Sources

À lire aussi dans Guides