MiniMax H3, Gemini Omni 1.1 ou Wan 3.0 : trois modèles audio-vidéo, trois façons d’écrire le prompt

Les trois génèrent image et son en un seul passage, et aucun ne lit le prompt comme les autres : H3 attend un document à champs, Omni une légende avec une clause de continuité, Wan une formule additive. Les prix, les limites, et la règle qui fait échouer chacun d’eux.

Publié:

Trois ondes sonores lumineuses sur fond noir : une grille de cellules indigo, un trait d'encre turquoise et de la soie ambrée, qui convergent vers un point brillant à droite.

Trois modèles vidéo sont arrivés sur LUVI à une semaine d’écart en septembre, avec la même promesse en titre : un son généré en même temps que l’image, dialogues compris. Ils ne partagent pas la même langue de prompt. Nous avons écrit un guide de prompt pour chacun à partir de la documentation de son éditeur, et cette comparaison est ce qui en est ressorti.

Les chiffres

  • Prix de base sur LUVI. H3 à partir de 2 080 crédits pour 8 s (H3 Max : 1 216). Omni 1.1 Flash à partir de 2 200 crédits pour 10 s. Wan 3.0 à partir de 2 000 crédits pour 5 s (Prime : 2 800).
  • Résolutions natives. H3 : 480P, 768P, 2K. Omni : 360p et 720p, le 1080p et le 4K passant par l’agrandisseur de Google. Wan : 480p, 720p, 1080p.
  • Durée du clip. H3 : 4 à 15 s. Omni : 3 à 10 s, prolongeable jusqu’à 40 s. Wan : jusqu’à 30 s.
  • Modes sur LUVI. H3 : texte, image, référence. Omni : texte, image, référence, retouche, prolongation. Wan : texte, image, référence.
  • Langues de dialogue. H3 : 11 (le turc n’en fait pas partie). Omni : l’anglais est évalué, les autres langues peuvent fonctionner. Wan : chinois et anglais.
  • Médias de référence. H3 : jusqu’à 9 images, 3 clips, 3 audios, 12 fichiers au total. Omni : des images et jusqu’à 3 clips courts, pas d’audio. Wan : jusqu’à 10 images, 5 clips, 5 audios, 20 fichiers.

MiniMax H3 : pourquoi le prompt est-il un document ?

Parce que H3 ne veut pas d’une légende. Il attend trois champs nommés, integrated_multimodal_description, overall_soundscape et non_diegetic_music, et il les attend tous les trois à chaque fois. Omettez un champ audio et le modèle ne se tait pas : il invente. La caméra s’écrit en prose à partir de douze verbes précis et de quatre modificateurs (« The camera pushes in with small amplitude at slow speed toward… »), les coupes sont datées à la milliseconde (« [Shot 2] At 00:03.500, the camera cuts to… »), et le dialogue se loge dans une balise avec sa langue : <d>[English] I get off at the next station.</d>. Un nom propre, qu’il s’agisse d’une célébrité, d’un film ou d’une marque, bloque toute la requête. Les commandes de caméra entre crochets de l’ancienne gamme Hailuo sont ici une syntaxe morte.

Son point fort : les séquences scénarisées à plusieurs plans avec dialogues, et les packs de références qui verrouillent un visage et une voix à la fois.

Gemini Omni 1.1 : pourquoi une légende doit-elle réclamer un plan unique ?

Parce qu’Omni coupe par défaut. Le modèle est d’un tempérament opposé : une légende de 45 mots en prose simple est le prompt idéal, et il complète le monde tout seul. Le piège, c’est que si vous demandez un plan au bord d’un lac, vous pouvez recevoir trois plans enchaînés au lieu d’un. Tout prompt à plan unique a besoin d’une clause de continuité dès la première phrase (« In a single unbroken scene… »). Le son va dans sa propre phrase derrière « Sound design: », la musique doit être demandée explicitement, et le dialogue s’écrit avec un deux-points et sans guillemets : des guillemets gravent les mots dans l’image sous forme de texte à l’écran. Il n’y a pas de champ négatif, les exclusions sont des fragments placés en fin de prompt (« No dialogue. No text overlay on screen. »). Une retouche tient en une proposition suivie de « Keep everything else the same. »

Son point fort : des clips rapides, peu coûteux et d’aspect naturel, des retouches conversationnelles, et la prolongation d’un clip que vous avez déjà.

Wan 3.0 : qu’est-ce que la formule additive ?

C’est l’ordre de lecture qu’Alibaba publie, et le modèle lit le prompt dans cet ordre : entité + décor + mouvement, puis contrôle esthétique + stylisation, puis son (voix = répliques + émotion + tonalité + vitesse + timbre + accent, effets = source + action + ambiance, musique = partition + style), puis l’enchaînement de plans sous la forme « Shot 1 [0–3 s] … Shot 2 [4–6 s] Hard cut transition, fixed camera… ». Les médias importés sont désignés par leur nom et employés comme des noms communs : « The cat in Image 1 plays in the room in Image 2. » Sa propre liste d’interdits est courte et mérite d’être apprise par cœur : pas de personne réelle nommée, pas de changements de scène rapides dans un même clip, pas de plan bâti sur un texte exact ni sur une synchronisation labiale au mot près.

Son point fort : les clips longs (30 s), les packs de références mixtes avec audio, et les dialogues en chinois.

La règle qui fait échouer chacun d’eux

  • H3 : omettre un champ audio. Vous obtenez un son inventé, pas du silence.
  • Omni : oublier la clause de continuité. Vous obtenez des coupes.
  • Wan : nommer une personne réelle. La requête échoue.

Lequel choisir ?

Une scène de dialogue avec une distribution verrouillée : H3. Un brouillon rapide ou la retouche de quelque chose qui existe déjà : Omni. Un clip long ou un pack de références qui comprend une voix : Wan 3.0. Les trois guides sont sur les pages des modèles (MiniMax H3, Gemini Omni, Wan), et l’espace de travail les applique quand le guide de prompt est activé. Pour comprendre comment les prix en crédits ci-dessus se construisent, lisez comment fonctionnent les crédits.

Questions

Lequel est le moins cher ?

Pour un clip court à la résolution de base : Wan 3.0 à partir de 2 000 crédits (5 s), MiniMax H3 à partir de 2 080 crédits (8 s), Gemini Omni 1.1 à partir de 2 200 crédits (10 s). À la seconde, Omni est le moins cher des trois dans son réglage par défaut.

Lequel garde un personnage d’un plan à l’autre ?

Les trois acceptent des médias de référence. Wan 3.0 prend jusqu’à 20 fichiers, audio compris. H3 en prend jusqu’à 12, entre images, clips et voix. Omni accepte des images et de courts clips, mais pas d’audio.

Lequel peut être retouché après coup ?

Omni 1.1 dispose d’une variante de retouche vidéo sur LUVI, Wan 3.0 aussi (la gamme 2.7). H3 non : vous relancez la génération.