Quels modèles génèrent le son avec la vidéo ?
Seedance 2.0 et 2.5, Veo 3.1, Gemini Omni, MiniMax H3, HappyHorse, FLUX 3 Video, Grok Imagine Video et Kling 3 produisent la bande-son dans la même passe que l'image — dialogues, effets, ambiance et musique — mais diffèrent sur l'activation par défaut de l'audio et son éventuel surcoût.
Les familles audio-vidéo conjointes
| Famille | Audio par défaut | Effet sur le prix | Comment demander du son |
|---|---|---|---|
| Seedance 2.0 / 2.5 | activé | inclus | canaux audio typés dans le prompt |
| Veo 3.1 | désactivé | standard ×2, Fast ×1,2, Lite sans audio | activer generate_audio, décrire le son |
| Gemini Omni 1.1 | activé, sans interrupteur | inclus | le décrire en prose |
| MiniMax H3 | toujours activé | inclus | balises de dialogue et ligne de paysage sonore |
| HappyHorse 1.0 / 1.1 | activé | inclus | doit être nommé en mots, sinon quasi-silence |
| FLUX 3 Video | activé, désactivable | inclus | un locuteur doit être visible pour les répliques |
| Grok Imagine Video | toujours activé | inclus | nommer le son, la négation est ignorée |
| Kling 3 (v3.0, O3) | activé | varie selon la ligne, visible dans l'estimation | étiquettes de locuteur pour les dialogues |
Chaque famille a un guide de prompt sur sa page de modèle ; la syntaxe audio est ce qui varie le plus entre elles.
Trois choses à savoir avant de générer
- Le silence est un paramètre, pas une phrase. « Pas de musique » dans le prompt ne rend aucun modèle muet ; Grok et H3 l'ignorent, d'autres en déduisent de la musique. Utilisez l'interrupteur quand il existe.
- Le dialogue exige un locuteur visible sur FLUX 3 Video, et gagne à en avoir un partout ; une réplique entre guillemets sans personne à l'écran peut devenir du texte incrusté.
- Veo sort muet sauf demande. Son interrupteur audio est désactivé sur LUVI parce qu'il change le prix ; l'estimation se met à jour quand vous l'activez.
Les alternatives voix d'abord
Pour une voix précise, générez la parole avec un modèle de synthèse vocale (ElevenLabs, Gemini TTS, MiniMax Speech, Grok Speech), puis pilotez un modèle de synchronisation labiale avec. La durée de l'audio fixe alors le prix.
Questions fréquentes
Puis-je couper le son ?
Seulement quand le modèle a un interrupteur : Veo et FLUX 3 Video ont generate_audio. H3, Grok video et Gemini Omni génèrent toujours de l'audio ; sur Seedance, vous omettez le canal audio du prompt.
Pourquoi mon clip est-il revenu presque silencieux ?
La plupart de ces modèles ont besoin que le son soit nommé dans le prompt. HappyHorse, en particulier, renvoie un quasi-silence si aucune ligne audio n'est écrite ; le guide de prompt de la famille montre la syntaxe.
Puis-je plutôt ajouter une vraie piste vocale ?
Oui — les modèles de synchronisation labiale comme OmniHuman, VEED et sync prennent votre propre fichier audio et animent la bouche dessus.